NEWTYPE · OPEN BENCHMARK · OPEN BENCHMARK

NewtypeBench — 공개 검증을 통과한 방법론

“NewtypeBench evaluates AI coding agents on full-stack feature shipping — like SWE-Bench, but for the modern AI-native stack and judged by real production tests.”

  • corpus 123 tasks
  • HF v0.2.2
  • license BSL
  • stack FastAPI · React · Vite

leaderboard — 오픈 예정

PROVEN IN PUBLIC

숫자로 말합니다

공개 벤치마크 NewtypeBench에서 이미 실증된 지표입니다.

123
공개 벤치마크 태스크 (71 backend + 52 frontend)
32,885
1회 평가 시 실행 테스트
3
태스크 소스 OSS (42.7k★ / 3.6k★ / 44k★)
v0.2.2
공개 데이터셋 — Hugging Face (BSL)
30%
프런티어 모델 실측 — Claude Opus 4.7, 20-instance smoke (binary)
123/123
스키마 검증 통과

프런티어 모델의 실측 결과 30%를 숨기지 않습니다. 최고 수준의 모델도 이 수준입니다 — 그래서 측정이 필요합니다.

EXAMPLE

평가는 이렇게 생겼습니다

자연어 스펙을 받은 에이전트가 4줄 patch를 제출하고, 하네스가 실행 결과로 자동 채점합니다.

backend/app/api/threads.py태스크 흐름 설명용 재구성 예시
  @@ -141,6 +141,10 @@ def register_routes(router):
      return ThreadListResponse(items=threads)
+ @router.get("/threads/{thread_id}/export")
+ def export_thread(thread_id: str, db=Depends(get_db)):
+     thread = get_or_404(db, Thread, thread_id)
+     return render_markdown_export(thread)
  1. FAIL패치 적용 전 — 신규 기능 테스트 실패
  2. RUNpytest · Playwright 실행 중 … 32,885 tests
  3. PASSFAIL_TO_PASS 940 통과 ∧ PASS_TO_PASS 31,945 무회귀

직접 확인하십시오

방법론·스코어링 로직·데이터셋 전부가 공개되어 있습니다. 회사 이름은 벤치마크에 등장하지 않습니다 — 중립성 원칙입니다.

WHY THIS STACK

AI 제품을 만드는 사람들의 스택에서, AI 에이전트를 평가한다

평가 스택은 임의 선택이 아닙니다 — 각 카테고리 사용률 1위 도구로 구성했습니다.

스택 서베이 근거

기술사용률출처
React82%State of JS 2024 · 카테고리 1위
Vite78.1%State of JS 2024 · 카테고리 1위
Tailwind62%State of CSS 2024 · 카테고리 1위
FastAPI38%JetBrains 2024 · 카테고리 1위

─ Indeed “fastapi react” 채용 공고 16,209건

벤치마크 지형에서의 고유 축

벤치마크측정 영역
SWE-Bench성숙 라이브러리 버그픽스
FullStackBench일반 코드 품질
Terminal-BenchCLI 작업
NewtypeBench모던 AI-native 스택 × 풀스택 기능 shipping