정량화
0/1 이진 판정과 통과율. “잘 되는 것 같다”가 아니라 숫자로 말합니다. 판정 기준이 객관적이어야 숫자가 신뢰를 얻습니다.
NewtypeBench 평가 방법론
NEWTYPE · AGENT EVALUATION · ENTERPRISE AGENT EVALUATION
사람이 실제로 수행한 업무를 기준으로, 도메인 지식 없이도 에이전트의 성능과 품질을 정량 판정합니다. 판정자는 사람의 주관이 아니라 실행 결과입니다.
세상에는 이미 수많은 에이전트·AI 모델 벤치마크가 있습니다
그러나 당신이 구축하려는 에이전트는, 이 중 어느 벤치마크로도 평가할 수 없습니다.
기업의 업무는 일반 지식 도메인과 다르고, 업무 흐름은 훨씬 복잡하고 정교하기 때문입니다. 그래서 평가 기준은 벤치마크 점수가 아니라, 당신의 조직에서 사람이 실제로 수행한 업무여야 합니다.
WHY EVALUATION
데모 시연은 실제 업무 수행 능력이 아닙니다. HumanEval 류의 벤치마크 점수는 우리 회사 업무 능력이 아닙니다. 도입의 성과를 말하려면, 업무 그 자체를 기준으로 측정해야 합니다.
“구축된 에이전트가 사람이 수행한 업무 대비 얼마나 정확한지를 평가해야만, 해당 에이전트 구축 프로젝트의 성과를 정확하게 측정할 수 있다.”
0/1 이진 판정과 통과율. “잘 되는 것 같다”가 아니라 숫자로 말합니다. 판정 기준이 객관적이어야 숫자가 신뢰를 얻습니다.
NewtypeBench 평가 방법론
판정 기준은 도메인 전문 지식이 아니라 실제 업무 산출물과의 비교입니다. 평가자가 해당 도메인 전문가일 필요가 없습니다.
“정답 = 실제 머지된 PR” 원칙의 일반화
6개월 뒤 다른 환경에서 다시 돌려도 같은 결과가 나옵니다. 컨테이너로 고정된 평가 환경이 재현성을 보증합니다.
Docker 기반 재현 환경
HOW IT WORKS
LLM-as-judge를 쓰지 않습니다. 판정자는 pytest와 Playwright의 실행 결과뿐입니다. 평가자가 도메인 전문가일 필요가 없는 이유입니다.
사람이 실제 수행한 업무 산출물을 정답(ground truth)으로 확보합니다.
업무 지시(spec) + 시작 상태 + 판정 기준을 재현 가능한 태스크로 패키징합니다.
에이전트가 동일 조건에서 업무를 수행합니다. 정답은 비공개입니다.
신규 과업 통과 ∧ 기존 업무 무회귀 — 실행 결과로만 판정합니다.
FAIL_TO_PASS PASS_TO_PASS → 새로 해내야 하는 일을 해냈는가 ∧ 기존에 되던 일을 깨뜨리지 않았는가. 집합 연산으로 자동 도출 — 수동 라벨링 없음.
7단계 큐레이션 파이프라인
SERVICE 01 — EVALUATION
실제 수행된 업무를 기준으로, 새로 해내야 할 일은 해내고 기존에 되던 일은 깨뜨리지 않는지를 실행으로 판정합니다. 점수는 0 또는 1.
에이전트의 최종 산출물만 받아 채점합니다. 고객사 에이전트의 내부 구조를 공개할 필요가 없습니다.
SWE-Bench 호환 patch 인터페이스
고객사 에이전트가 실제 작업 환경에 접속해 업무를 수행하고, 하네스가 결과를 자동 추출·채점합니다.
Agent-loop 인터페이스
에이전트 v N vs v N−1 상대 비교. 개선 루프의 계기판이 됩니다.
버전 간 상대 시그널 측정
복수 후보(모델·벤더)를 동일 조건에서 비교해 도입 의사결정의 근거를 제공합니다.
3~5개 프런티어 모델 평가
| 구분 | 정의 범위 |
|---|---|
| 우리가 정의 | 태스크 스펙 + 채점 코어 + 환경 재현성 |
| 고객이 정의 | 에이전트 설계 전부 — 프롬프트, 도구, 모델 선택, 루프 전략 |
─ 이 경계가 그대로 서비스 계약 구조가 됩니다 — 평가 전문 회사의 중립성.
SERVICE 02 — BUILD
평가만 하는 회사가 아닙니다. 도메인 특화 에이전트를 직접 구축하고, 그 성과를 스스로 측정합니다. 우리는 “평가 가능하게 설계된 구축”을 합니다 — 착수 시점부터 “이 에이전트의 성공을 무엇으로 판정할 것인가”를 함께 정의하고, 납품 시 정량 평가 리포트가 함께 나옵니다.
회의록·보고서 요약, 문서 분류·번역. 사람이 작성한 결과물이 곧 채점 기준입니다.
ground truth: 담당자가 실제 작성한 요약·분류 결과
결재 문서 분석, 규정 위반 검출, 승인 라우팅. 과거 처리 이력과 비교해 판정합니다.
ground truth: 과거 결재 처리 이력
정기 리포트 생성, 지표 집계·이상 탐지. 기존 리포트 대비 정확도를 측정합니다.
ground truth: 사람이 산출한 기존 리포트
코드 변경, 티켓 처리, 장애 대응 초동 분석. 머지된 PR·처리 완료 티켓이 정답입니다.
NewtypeBench 방법론 직접 적용
특정 산업 지식이 아니라 “업무 이력이 남는 곳이면 어디든” — 도메인 불문 원칙의 예시입니다.
─ 평가 방법론과 동일한 엔진을 구축 사업의 품질 관리에 사용합니다. 구축과 평가가 한 회사 안에 있어야 가능한 구조입니다.
THE FLYWHEEL
사람이 수행한 업무 대비 에이전트의 정확도를 측정해야, 구축 프로젝트의 ROI를 말할 수 있습니다.
업무 이력이 남는 곳이면 어디든
= 정답 (ground truth)
정확도 · 회귀 · 비용
평가 결과가 다음 개선 사이클의 입력이 됩니다 — 평가는 개선 루프의 심장입니다.
Docker 기반 평가 하네스는 같은 폐쇄망 안에서 돌아갑니다. 로컬 LLM으로 구축한 에이전트도 사내에서 그대로 측정합니다.
“주 목적은 에이전트의 내부 품질 개선 루프, 공개 리더보드는 부산물”. 구축 사업의 품질 관리도 같은 자기 평가 루프로 돌립니다.
TRUST
자사 에이전트에 불리한 태스크도 필수 포함합니다. 불리한 점수도 공개를 약속합니다. 벤치마크에는 벤더명을 배제합니다.
태스크를 public / held_out / internal_only 티어로 분리하고, 모델 cutoff 이후 데이터만 held-out으로, 시즌 단위로 로테이션합니다. 에이전트가 답을 미리 외웠을 가능성까지 통제합니다.
방법론·스코어링 로직·재현 절차를 전면 공개합니다. 누구든 같은 절차로 같은 결과를 재현할 수 있습니다.
BSL 소스 공개 + 공개 데이터셋
“자사에 불리한 결과도 공개합니다. 그것이 평가 회사의 자격이라고 믿습니다.”─ 공정성 서약