파이프라인 병렬 레이어 분할
GGUF 메타데이터를 읽어 노드별 레이어 배치, KV-캐시·expert VRAM을 계획하고, GPU 없는 마스터가 다수 워커를 지휘합니다.
NEWTYPE · TECHNOLOGY · TECHNOLOGY — R&D
NEWTYPE은 어떤 컴퓨팅 유닛에서도 AI 모델의 학습과 추론의 성능을 보장할 수 있도록 연구 개발을 지속하고 있습니다. 엣지 디바이스 한 대부터, 스마트폰이 섞인 이기종 분산 스웜까지.
PATENT-PENDING
「직교 변환 기반 회전 공간 정렬을 이용한 인공지능 가속장치 및 방법」 — 엣지 디바이스의 NPU에서 거대 모델의 추론과 학습을 함께 수행하기 위한 가속 아키텍처입니다. 낮은 비트로 줄인 모델의 정확도를, 같은 회전 공간의 고정밀 어댑터가 되살립니다.
외부 컴퓨팅 환경에서 원본 가중치에 입력·출력 직교 행렬을 적용한 회전 가중치를 저정밀 포맷으로 양자화해 엣지 디바이스에 제공합니다.
입력 데이터에 직교 변환을 적용해 베이스 가중치와 동일한 회전 공간으로 정렬합니다. 덧셈·뺄셈만 수행합니다.
회전 공간 입력으로 베이스 경로(저정밀)와 어댑터 경로(고정밀)를 각각 연산합니다.
두 결과를 병합하고 출력측 직교 변환을 적용합니다. 역전파 시 같은 회로로 기울기를 변환해 어댑터를 갱신합니다.
─ 특허출원 2026.06 (심사청구 완료)
DISTRIBUTED INFERENCE
단일 머신에 담을 수 없는 100B+ 모델을 다수의 GPU·머신, 그리고 스마트폰까지 걸쳐 추론합니다. GPU 없는 컨트롤러가 레이어와 expert의 배치를 계획하고, RPC 데이터 플레인이 실행합니다.
GGUF 메타데이터를 읽어 노드별 레이어 배치, KV-캐시·expert VRAM을 계획하고, GPU 없는 마스터가 다수 워커를 지휘합니다.
122B MoE 모델의 무게 대부분은 수천 개의 ~5MB expert. 레이어가 아닌 expert 단위로 샤딩해 4GB 폰도 슬라이스를 보유·연산합니다. 라우터 권한은 백본이 가집니다.
CUDA·ROCm·Adreno·CPU는 비트 단위로 같지 않지만 수치적으로 등가입니다. 라우터 권한 설계로 이산 발산을 유계 연속 오차로 바꿔, 혼합 하드웨어 스웜이 동일한 토큰을 방출합니다.
실제 122B 추론에 스마트폰이 엔드투엔드로 참여 — expert 슬라이스를 자율 다운로드해 서빙하며, 매 토큰마다 한 레이어의 expert를 연산했습니다. 결과 토큰은 레퍼런스와 동일합니다.