veneta

뉴스 · 2026-10-07

MTP 추측 디코딩용 한국어 드래프트 어휘사전을 측정해 공개했습니다

Qwen3.8-Flash-Next에서 한국어 디코딩이 초당 16.9에서 26.1 토큰(+54%)으로 빨라지는 MTP 추측 디코딩용 한국어 드래프트 어휘사전을 DGX Spark 1대에서 측정해 Apache-2.0으로 공개했습니다.

VENETA Inc. · 오픈소스

MTP 헤드가 있는 로컬 모델은 드래프트 헤드의 출력을 빈도 상위 어휘로 제한해 토큰 여러 개를 한 번에 제안합니다. 검증은 본 모델이 전체 어휘로 하므로 출력은 그대로입니다. 지금 커뮤니티가 배포하는 부분집합은 영어와 코드 기준이라 한국어 드래프트는 거절되고 디코딩이 느려집니다.

측정한 것

Qwen3.8-Flash-Next(nvidia/Qwen3.8-Flash-Next-NVFP4, DGX Spark 1대, 3회 중앙값)에서, 커뮤니티가 이미 공개한 다른 여섯 언어와 같은 방식으로 만든 한국어 드래프트 어휘사전으로 디코딩이 초당 16.9에서 26.1 토큰(+54%)으로 빨라졌고, 드래프트당 수락 토큰도 1.33에서 2.16으로 늘었습니다. 품질은 유지됐습니다. 모든 생성에서 대체 문자(U+FFFD) 0개, 깨진 한국어 스크립트 0개, 자체 기억 능력 회귀 테스트 12문항도 영향 없음이었습니다.

공개한 것과 아직 없는 것

어휘사전 파일, 빌드 스크립트, 모든 측정 원본 파일을 Apache-2.0으로 공개했습니다: 깃허브, 허깅페이스. 지금은 Qwen3.8-Flash-Next만 측정했고, 다른 모델 가족과 별도 드래프터 구조용 범용 패치는 아직 진행 중입니다.

노트는 project 사이트에 있습니다. MTP 추측 디코딩

뉴스 목록