NEWTYPE · AGENT EVALUATION · ENTERPRISE AGENT EVALUATION

당신의 에이전트는 그 업무를 정말로 해낼 수 있습니까?

사람이 실제로 수행한 업무를 기준으로, 도메인 지식 없이도 에이전트의 성능과 품질을 정량 판정합니다. 판정자는 사람의 주관이 아니라 실행 결과입니다.

세상에는 이미 수많은 에이전트·AI 모델 벤치마크가 있습니다

  • MMLU
  • GPQA
  • HumanEval
  • SWE-Bench
  • MMMU
  • ARC-AGI
  • Terminal-Bench
  • LiveCodeBench
  • MATH
  • WebArena
  • AIME
  • HellaSwag
  • …그리고 수백 개 더

그러나 당신이 구축하려는 에이전트는, 이 중 어느 벤치마크로도 평가할 수 없습니다.

기업의 업무는 일반 지식 도메인과 다르고, 업무 흐름은 훨씬 복잡하고 정교하기 때문입니다. 그래서 평가 기준은 벤치마크 점수가 아니라, 당신의 조직에서 사람이 실제로 수행한 업무여야 합니다.

WHY EVALUATION

에이전트를 도입했다. 그런데 얼마나 잘하는지 어떻게 아는가?

데모 시연은 실제 업무 수행 능력이 아닙니다. HumanEval 류의 벤치마크 점수는 우리 회사 업무 능력이 아닙니다. 도입의 성과를 말하려면, 업무 그 자체를 기준으로 측정해야 합니다.

“구축된 에이전트가 사람이 수행한 업무 대비 얼마나 정확한지를 평가해야만, 해당 에이전트 구축 프로젝트의 성과를 정확하게 측정할 수 있다.”

정량화

0/1 이진 판정과 통과율. “잘 되는 것 같다”가 아니라 숫자로 말합니다. 판정 기준이 객관적이어야 숫자가 신뢰를 얻습니다.

NewtypeBench 평가 방법론

도메인 불문

판정 기준은 도메인 전문 지식이 아니라 실제 업무 산출물과의 비교입니다. 평가자가 해당 도메인 전문가일 필요가 없습니다.

“정답 = 실제 머지된 PR” 원칙의 일반화

재현성

6개월 뒤 다른 환경에서 다시 돌려도 같은 결과가 나옵니다. 컨테이너로 고정된 평가 환경이 재현성을 보증합니다.

Docker 기반 재현 환경

HOW IT WORKS

4단계 평가 파이프라인

LLM-as-judge를 쓰지 않습니다. 판정자는 pytest와 Playwright의 실행 결과뿐입니다. 평가자가 도메인 전문가일 필요가 없는 이유입니다.

  1. [1] 업무 이력 수집

    Ground Truth 확보

    사람이 실제 수행한 업무 산출물을 정답(ground truth)으로 확보합니다.

  2. [2] 태스크 변환

    재현 가능한 패키징

    업무 지시(spec) + 시작 상태 + 판정 기준을 재현 가능한 태스크로 패키징합니다.

  3. [3] 에이전트 실행

    동일 조건 수행

    에이전트가 동일 조건에서 업무를 수행합니다. 정답은 비공개입니다.

  4. [4] 자동 채점

    0 또는 1

    신규 과업 통과 ∧ 기존 업무 무회귀 — 실행 결과로만 판정합니다.

FAIL_TO_PASS PASS_TO_PASS → 새로 해내야 하는 일을 해냈는가 ∧ 기존에 되던 일을 깨뜨리지 않았는가. 집합 연산으로 자동 도출 — 수동 라벨링 없음.

  • 시험 문제 유출 없음 — 에이전트에게 절대 주지 않는 것: 정답, 판정 기준, 힌트.
  • 기준 조작 원천 차단 — 채점 기준은 하네스가 채점 직전 강제 주입합니다. 에이전트가 테스트를 수정해도 소용없습니다.
  • 주관 배제 — 넓게 측정하면 “무엇이 좋은 코드인가”라는 주관에 빠집니다. “테스트가 통과하는가”는 객관적입니다.

7단계 큐레이션 파이프라인

  1. 크롤
  2. 필터
  3. 분포 점검
  4. 판정 신호 자동 추출
  5. 인스턴스 변환
  6. 스키마 검증
  7. 오염 티어 지정

SERVICE 01 — EVALUATION

에이전트 성능 평가 서비스

실제 수행된 업무를 기준으로, 새로 해내야 할 일은 해내고 기존에 되던 일은 깨뜨리지 않는지를 실행으로 판정합니다. 점수는 0 또는 1.

산출물 평가

에이전트의 최종 산출물만 받아 채점합니다. 고객사 에이전트의 내부 구조를 공개할 필요가 없습니다.

SWE-Bench 호환 patch 인터페이스

에이전트 루프 평가

고객사 에이전트가 실제 작업 환경에 접속해 업무를 수행하고, 하네스가 결과를 자동 추출·채점합니다.

Agent-loop 인터페이스

버전 간 회귀 측정

에이전트 v N vs v N−1 상대 비교. 개선 루프의 계기판이 됩니다.

버전 간 상대 시그널 측정

모델·에이전트 비교 평가

복수 후보(모델·벤더)를 동일 조건에서 비교해 도입 의사결정의 근거를 제공합니다.

3~5개 프런티어 모델 평가

역할 경계 — 우리는 심판이지 코치가 아닙니다

구분정의 범위
우리가 정의태스크 스펙 + 채점 코어 + 환경 재현성
고객이 정의에이전트 설계 전부 — 프롬프트, 도구, 모델 선택, 루프 전략

─ 이 경계가 그대로 서비스 계약 구조가 됩니다 — 평가 전문 회사의 중립성.

SERVICE 02 — BUILD

도메인 특화 에이전트 구축

평가만 하는 회사가 아닙니다. 도메인 특화 에이전트를 직접 구축하고, 그 성과를 스스로 측정합니다. 우리는 “평가 가능하게 설계된 구축”을 합니다 — 착수 시점부터 “이 에이전트의 성공을 무엇으로 판정할 것인가”를 함께 정의하고, 납품 시 정량 평가 리포트가 함께 나옵니다.

문서 업무

회의록·보고서 요약, 문서 분류·번역. 사람이 작성한 결과물이 곧 채점 기준입니다.

ground truth: 담당자가 실제 작성한 요약·분류 결과

결재·승인 워크플로

결재 문서 분석, 규정 위반 검출, 승인 라우팅. 과거 처리 이력과 비교해 판정합니다.

ground truth: 과거 결재 처리 이력

데이터·리포팅

정기 리포트 생성, 지표 집계·이상 탐지. 기존 리포트 대비 정확도를 측정합니다.

ground truth: 사람이 산출한 기존 리포트

개발·IT 업무

코드 변경, 티켓 처리, 장애 대응 초동 분석. 머지된 PR·처리 완료 티켓이 정답입니다.

NewtypeBench 방법론 직접 적용

특정 산업 지식이 아니라 “업무 이력이 남는 곳이면 어디든” — 도메인 불문 원칙의 예시입니다.

구축 프로세스 — 평가와 같은 엔진

  1. 업무 이력 수집·태스크화
  2. 에이전트 설계·구축
  3. 정량 평가 — 사람 수행 대비 정확도
  4. 평가 리포트 기반 개선

─ 평가 방법론과 동일한 엔진을 구축 사업의 품질 관리에 사용합니다. 구축과 평가가 한 회사 안에 있어야 가능한 구조입니다.

THE FLYWHEEL

구축의 성과는 평가로만 증명됩니다

사람이 수행한 업무 대비 에이전트의 정확도를 측정해야, 구축 프로젝트의 ROI를 말할 수 있습니다.

  1. ①

    도메인 특화 에이전트 구축

    업무 이력이 남는 곳이면 어디든

  2. ②

    사람이 수행한 업무 이력

    = 정답 (ground truth)

  3. ③

    정량 평가

    정확도 · 회귀 · 비용

평가 결과가 다음 개선 사이클의 입력이 됩니다 — 평가는 개선 루프의 심장입니다.

폐쇄망에서도 평가는 망 밖으로 나가지 않습니다

Docker 기반 평가 하네스는 같은 폐쇄망 안에서 돌아갑니다. 로컬 LLM으로 구축한 에이전트도 사내에서 그대로 측정합니다.

NewtypeBench의 설계 사상과 동형

“주 목적은 에이전트의 내부 품질 개선 루프, 공개 리더보드는 부산물”. 구축 사업의 품질 관리도 같은 자기 평가 루프로 돌립니다.

TRUST

평가 회사의 상품은 결국 신뢰입니다

공정성 — Fairness-first

자사 에이전트에 불리한 태스크도 필수 포함합니다. 불리한 점수도 공개를 약속합니다. 벤치마크에는 벤더명을 배제합니다.

오염 방어 — Contamination mitigation

태스크를 public / held_out / internal_only 티어로 분리하고, 모델 cutoff 이후 데이터만 held-out으로, 시즌 단위로 로테이션합니다. 에이전트가 답을 미리 외웠을 가능성까지 통제합니다.

투명성

방법론·스코어링 로직·재현 절차를 전면 공개합니다. 누구든 같은 절차로 같은 결과를 재현할 수 있습니다.

BSL 소스 공개 + 공개 데이터셋

“자사에 불리한 결과도 공개합니다. 그것이 평가 회사의 자격이라고 믿습니다.”─ 공정성 서약