NEWTYPE · TECHNOLOGY · TECHNOLOGY — R&D

어떤 컴퓨팅 유닛에서도, 학습과 추론을 보장합니다

NEWTYPE은 어떤 컴퓨팅 유닛에서도 AI 모델의 학습과 추론의 성능을 보장할 수 있도록 연구 개발을 지속하고 있습니다. 엣지 디바이스 한 대부터, 스마트폰이 섞인 이기종 분산 스웜까지.

PATENT-PENDING

엣지 AI 가속 — 특허 출원 기술

「직교 변환 기반 회전 공간 정렬을 이용한 인공지능 가속장치 및 방법」 — 엣지 디바이스의 NPU에서 거대 모델의 추론과 학습을 함께 수행하기 위한 가속 아키텍처입니다. 낮은 비트로 줄인 모델의 정확도를, 같은 회전 공간의 고정밀 어댑터가 되살립니다.

  • 저정밀도(INT4·FP4·NF4) 베이스 가중치 + 고정밀(FP16·BF16·FP32) 저랭크 어댑터 — 동일한 회전 공간(rotated space)에서 양자화 정확도 저하를 보완
  • 고속 월시-하다마드 변환(FWHT) 기반 직교 변환 — 부동소수점 곱셈 없이 덧셈·뺄셈만 수행하는 버터플라이 연산 회로
  • 직교 변환의 일부는 인접 레이어 가중치에 사전 병합 — 하드웨어는 병합되지 않은 나머지 변환만 입력·중간 데이터에 적용
  • 베이스 가중치 영역과 분리된 온칩 메모리(On-chip Memory)에 어댑터 저장 — 갱신 대상만 가까운 메모리에 유지
  • 중간 연산값은 베이스보다 높은 정밀도의 누산 포맷으로 누산 — 저정밀 연산의 오차 누적 방지
  • 역전파에서는 오차 기울기에 동일(또는 역방향) 변환을 적용해 회전 공간 기울기를 생성 — 순전파에 쓴 버터플라이 회로를 재사용해 온디바이스 어댑터 갱신(학습) 지원

작동 원리 — 4단계

  1. [1] 오프라인 전처리

    회전 → 양자화

    외부 컴퓨팅 환경에서 원본 가중치에 입력·출력 직교 행렬을 적용한 회전 가중치를 저정밀 포맷으로 양자화해 엣지 디바이스에 제공합니다.

  2. [2] 회전 공간 정렬

    FWHT 입력 변환

    입력 데이터에 직교 변환을 적용해 베이스 가중치와 동일한 회전 공간으로 정렬합니다. 덧셈·뺄셈만 수행합니다.

  3. [3] 이중 경로 연산

    BASE ∥ ADAPTER

    회전 공간 입력으로 베이스 경로(저정밀)와 어댑터 경로(고정밀)를 각각 연산합니다.

  4. [4] 병합 · 갱신

    출력 + 온디바이스 학습

    두 결과를 병합하고 출력측 직교 변환을 적용합니다. 역전파 시 같은 회로로 기울기를 변환해 어댑터를 갱신합니다.

─ 특허출원 2026.06 (심사청구 완료)

DISTRIBUTED INFERENCE

분산 추론 엔진

단일 머신에 담을 수 없는 100B+ 모델을 다수의 GPU·머신, 그리고 스마트폰까지 걸쳐 추론합니다. GPU 없는 컨트롤러가 레이어와 expert의 배치를 계획하고, RPC 데이터 플레인이 실행합니다.

  • 백본 스테이지가 attention·KV·norm·라우터·shared expert·결합을 실행 — 라우터는 백본에서 한 번 실행되는 권한(authority)입니다
  • expert 워커는 순수 (hidden, local_ids) → out 함수 — 선택된 expert만 소유 노드로 디스패치되고 백본이 결과를 결합합니다
  • 플래너가 GGUF 메타데이터를 읽어 노드별 연속 레이어 배치, KV-캐시·expert VRAM, 노드 RAM으로의 expert FFN 오프로드까지 산정합니다
  • 안전한 계획에 필요한 자원 모니터링을 제공하지 못하는 노드에는 적재를 차단합니다 — 계획 없는 배치는 없습니다

파이프라인 병렬 레이어 분할

GGUF 메타데이터를 읽어 노드별 레이어 배치, KV-캐시·expert VRAM을 계획하고, GPU 없는 마스터가 다수 워커를 지휘합니다.

Expert 단위 샤딩

122B MoE 모델의 무게 대부분은 수천 개의 ~5MB expert. 레이어가 아닌 expert 단위로 샤딩해 4GB 폰도 슬라이스를 보유·연산합니다. 라우터 권한은 백본이 가집니다.

이종 백엔드 수치 등가성

CUDA·ROCm·Adreno·CPU는 비트 단위로 같지 않지만 수치적으로 등가입니다. 라우터 권한 설계로 이산 발산을 유계 연속 오차로 바꿔, 혼합 하드웨어 스웜이 동일한 토큰을 방출합니다.

모바일 노드 참여

실제 122B 추론에 스마트폰이 엔드투엔드로 참여 — expert 슬라이스를 자율 다운로드해 서빙하며, 매 토큰마다 한 레이어의 expert를 연산했습니다. 결과 토큰은 레퍼런스와 동일합니다.

122B
이기종 스웜 실측 검증 모델 규모
실측 검증
1.0
GPU 백엔드 간 cosine 유사도 (CUDA vs ROCm)
실측 검증
0.99975
GPU vs CPU cosine 유사도
실측 검증