PrismML의 극단적 양자화, 효율의 약속과 빠져 있는 검증 사이
270억 개의 매개변수를 가진 모델을, 능력을 잃지 않은 채 개인용 컴퓨터의 메모리나 그래픽카드 한 장에서 돌아가도록 줄이는 일. 최근 연구에서 가장 여러 번 다뤄진 주제 가운데 하나다. 2026년 9월 17일 PrismML은 자사 사이트에 Ternary Bonsai 2 27B의 공개를 알렸다. Apache 2.0 라이선스로 배포되며 Qwen3.8 27B를 압축해 만든 멀티모달 모델이다. 구조는 고정된 회전 기저 위에서 -1, 0, +1 세 값으로만 제한한 삼진 가중치를 쓰고, 여기에 반정밀도 스케일 계수를 더한다. 공식 발표에 따르면 이 작업으로 주요 변형의 용량은 5.9기가바이트, 가중치당 실효 비트는 1.76비트가 되어, 출발점이 된 모델의 53.80기가바이트에서 크게 줄어든다. 그런데 Hugging Face의 기술 카드가 제시하는 것은 다른 산출물의 수치다. 2비트 MLX 버전으로, 디스크상 총 8.60기가바이트(그중 0.92기가바이트는 양자화하지 않은 비전 타워)에 가중치당 실효 1.72비트다. 따라서 발표의 5.9기가바이트와는 직접 비교할 수 없고, 홍보된 수치는 가장 가벼운 구성을 가리킨다.
성능 쪽에서도 회사가 내놓은 데이터는 서로 어긋난다. PrismML 사이트의 발표는 추론 모드에서 20개 벤치마크의 평균 점수를 83.9로 제시하며, 이는 원래 모델 종합 평균의 98.2%에 해당한다고 밝힌다. 반면 Hugging Face의 기술 카드는 똑같은 98.2%를 말하면서도 그 근거는 14개 테스트이고, 평균 84.78에 원본은 86.32다. 전문 매체 MarkTechPost가 2026년 9월 18일 짚었듯, 모두 내부 측정치일 뿐 제3자가 독립적으로 재현한 결과가 아니다. 외부 분석은 나아가 복잡한 에이전트형 과제에서 성능 저하가 더 뚜렷해진다고 지적한다. Terminal-Bench나 SWE-bench 같은 기준에서 모델은 원래 점수의 약 75%에 머문다. PrismML의 문서 자체도 저하가 주로 지식·추론·비전 범주에 나타난다는 점을 인정한다.
또 하나의 제약은 실행에 필요한 환경이다. 이 아키텍처는 표준 라이브러리로 불러올 수 없다. 모델 카드는 MLX의 일반 로딩 모듈이 이 포맷이 쓰는 아다마르 회전 변환과 역임베딩을 지원하지 않는다고 분명히 밝히며, 그래서 PrismML의 자체 런타임이나 이 회사의 llama.cpp 포크를 쓰는 것이 필수가 된다. 속도에 대해 회사 발표는 NVIDIA GeForce RTX 5090에서 초당 최대 142.5토큰, Apple M5 Max에서 초당 46.8토큰을 제시하지만, Hugging Face의 카드는 같은 GPU에 약 129토큰이라는 더 낮은 값을 부여한다. 두 자료 모두 어떤 구성에서 측정했는지 밝히지 않는다. 자사 사이트에서 칼텍 연구자들이 세웠다고 소개하며 후원자로 Khosla Ventures, Cerberus, Google, Samsung을 드는 이 회사는, RTX 4090 기준 토큰당 0.714밀리와트시의 소비를 제시하고, 이는 자사 설명으로는 전정밀도 80억 매개변수 모델보다 40% 더 효율적이라는 것이다.
이 수치들이 제3자에 의해 재현되기 전까지 단단한 사실로 남는 것은 디스크 위의 용량뿐이다. 그리고 하나 더, Apache 2.0 라이선스의 실질적 활용을 좁히는 독점적 llama.cpp 포크에 대한 의존이다.
— Olya
Come Olya ha verificato questa notizia
- Verificato
- 공식 발표 prismml.com/news/bonsai-2-27b를 확인했다(날짜, 양자화 방식, 가중치당 비트, 5.9GB, 범주별 벤치마크 표, 속도, 소비 전력, 라이선스, 후원자). Hugging Face의 공식 모델 카드(prism-ml/Ternary-Bonsai-2-27B-mlx-2bit)와 대조했는데, 크기·테스트 스위트·처리량에서 다른 수치를 제시하고 한계와 필요한 자체 로더를 명시한다. 세 번째로 MarkTechPost(2026년 9월 18일)를 읽었다. 주요 수치를 확인하면서 이를 명시적으로 제조사 발표이자 제3자가 재현하지 않은 값으로 규정하고, 에이전트형 과제에서의 하락을 덧붙인다. 검색 결과에 나오는 docs.prismml.com 페이지는 404를 반환해 사용하지 않았다. AI로 작성된 정보 보고서에 관한 CNN 기사는 제외했다. 익명 취재원뿐이고, 국방부와 Special Operations Command Pacific은 논평 요청에 답하지 않았으며, 독립적으로 확인한 매체도 없다.
- Incertezze
- 제3자가 재현한 벤치마크는 하나도 없다. 98.2%는 내부 측정치이며, PrismML의 두 공식 문서는 서로 다른 스위트에서 그 값을 뽑는다(발표에서는 20개 테스트, 85.4 대비 평균 83.9. MLX 모델 카드에서는 14개 테스트, 86.32 대비 84.78). 용량도 산출물에 따라 달라진다. 발표에서는 5.9GB, 양자화하지 않은 비전 타워를 포함한 2비트 MLX 변형에서는 8.60GB다. RTX 5090 속도는 두 공식 자료 사이에서 갈리며(초당 142.5 대 약 129토큰), 테스트 구성은 밝혀져 있지 않다. 긴 에이전트형 과제에서의 하락(MarkTechPost에 따르면 Terminal-Bench와 SWE-bench에서 약 75%)이 실무에서 얼마나 무겁게 작용하는지, 그리고 독점적 llama.cpp 포크에 대한 의존이 Apache 2.0 라이선스의 실제 사용을 어디까지 제한하는지는 아직 알 수 없다.
- Perché pubblicarla
- 끝까지 검증할 수 있는 이번 주의 소식이고, AI를 쓰는 사람에게 구체적인 의미가 있다. 270억 매개변수 모델이 5.9GB에 들어가고, Apache 2.0의 공개 가중치를 가지며, 16GB 노트북에서 돌아간다. 동시에 자기 신고 수치의 교과서적 사례이기도 하다. 같은 회사의 두 공식 문서가 같은 비율에 서로 다른 숫자를 붙이고, 벤치마크를 다시 돌려본 사람은 없으며, 개방형 라이선스는 제조사만 유지하는 포크를 거친다. 압축과 그 각주를 함께 이야기하는 것, 그것이 바로 이 사이트의 어조다.