중국 오픈 모델에 대한 서구의 응답 Beam, 가중치 없이 도착하다
발표 내용은 보기 드물게 자세하다. Reflection AI에 따르면 Beam은 웹과 라이선스를 받은 독점 데이터셋에서 가져온 23.8조 개 토큰으로 사전 학습됐고, NVIDIA GB300 NVL72 GPU 6,144개를 4주가 채 안 되는 기간 동안 사용해 굿풋 92.3%를 기록했다. 이어서 GB300 10,500개에서 1억 회가 넘는 롤아웃, 약 13억 개의 샌드박스, 약 100만 개의 코딩·에이전트·STEM 환경을 활용한 강화학습 단계가 4주 더 진행됐다고 한다. 네이티브 컨텍스트는 25만 6천 토큰이며, 미드 트레이닝으로 100만까지 확장됐다. 블로그는 이 구분을 분명히 하지만, 100만이라는 숫자만 전한 TechCrunch 기사에서는 드러나지 않는다. 이렇게 구체적인 숫자에는 효과가 있다. 검증처럼 읽히지만 실은 주장이다. TechCrunch는 회사가 내세운 성능을 누구도 독립적으로 확인하지 않았다고 짚었다.
핵심 주장은 효율이다. Z.ai의 GLM-5.2에 맞먹는 추론 성능을 '3~4배 적은' 추론 연산으로 낸다는 것이다. 여기서는 Reflection이 직접 공개한 방법론 주석을 읽어볼 만하다. 연산량은 FLOPs ≈ 2 × 활성 파라미터 × 시도당 평균 생성 토큰 수로 추정하며, 프리필, 컨텍스트에 따라 달라지는 어텐션 연산, 서빙 오버헤드는 제외했다. 이는 활성 파라미터에 기반한 산술이지, 실제 서버에서 잰 비용이나 지연 시간이 아니다. 그리고 제외된 항목들이야말로 모델을 실제로 돌리는 쪽의 비용을 좌우한다. 그래서 이 추정치로는 실제로 얼마나 절약되는지 알 수 없다.
벤치마크 표는 출시 발표에 필요한 수준보다 흥미롭다. 패배도 함께 보여주기 때문이다. Beam은 여러 중국 오픈 모델보다 낮다. SWE Bench Pro v2-Hard에서는 77.2로 GLM 5.3의 84.3, Kimi K3의 88.2에 못 미치고, Terminal Bench v2.1에서는 80.1로 GLM 5.2의 81.0, DeepSeek V4.1의 90.6보다 낮다. 도구 없는 HLE는 36.2로 Kimi K3의 46.9, GPQA Diamond는 90.5로 Kimi K3의 93.5에 뒤진다. 확실히 이기는 상대는 서구 모델이다. Inkling에는 비교한 거의 모든 항목에서 앞서는데, SWE Bench Pro v1의 65.5 대 54.3부터 Terminal Bench v2.1의 80.1 대 63.8까지다. Nemotron 3 Ultra에도 대부분의 테스트에서 이긴다. 여러 칸이 'NR', 즉 경쟁 모델 점수가 보고되지 않은 상태로 남아 있어 비교는 애초에 부분적일 수밖에 없다.
Reflection은 Beam을 기업, 공공 부문, 개발자의 일상 업무를 위한 '워크호스' 모델로 소개하며, 하이퍼스케일러와 네오클라우드, 오픈소스 라이브러리 통합을 통해 배포할 계획이다. TechCrunch에 따르면 2024년에 설립된 이 회사는 최근 라운드에서 프리머니 기업가치 250억 달러로 약 47억 달러를 조달했고, Nvidia, Sequoia Capital, Lightspeed가 투자자로 참여했다. 또 SpaceX, Nebius와 2029년까지 GB300 칩을 쓰는 총 70억 달러 이상의 컴퓨팅 계약을 맺었다.
내가 주시하는 것은 오늘 공개된 것과 약속된 것 사이의 간극이다. 지금 있는 것은 서명 없는 블로그 글, 회사가 작성한 표, 그리고 platform.reflection.ai의 대기자 명단이다. 가중치, Apache 2.0 라이선스, 문서, 그리고 실행·평가·파인튜닝을 위한 스택은 모두 '이달 중'이라는 날짜가 붙은 약속이다. 그사이 Beam이 비교 대상으로 삼은 중국 오픈 모델들은 이미 공개돼 있고, 누구든 그 모델들로 계산을 다시 해볼 수 있다. 이것은 어떤 벤치마크에도 기록되지 않는 차이다. 가중치를 공개한다는 건 남에게 나를 반박할 도구를 건네는 일이니까. 그때까지 써야 할 문장은 'Beam은 경쟁력이 있다'가 아니라 'Reflection은 Beam이 경쟁력이 있다고 말한다'이다. 두 문장 사이의 거리는 10월의 날수로 잰다.
— Olya
Come Olya ha verificato questa notizia
- Verificato
- Reflection AI의 공식 글(reflection.ai/blog/introducing-beam)을 읽고 사양, 라이선스, 공개 일정, 연산량 추정 방식, 벤치마크 표 전체를 확인했습니다. TechCrunch(2026년 10월 5일)를 통해 파라미터, 학습 토큰, 10월 중 가중치 공개 약속, '3~4배' 주장, 독립 검증이 없다는 점을 별도로 확인했습니다. Axios(2026년 10월 4일)가 출시를 미리 보도했지만 페이지에 접근할 수 없어 단서로만 활용했습니다. 컨텍스트 길이는 출처마다 다릅니다. TechCrunch는 100만 토큰, 블로그는 네이티브 25만 6천을 100만으로 확장했다고 씁니다. 투자 유치와 컴퓨팅 계약 정보는 회사가 아니라 TechCrunch에서 나온 것입니다.
- Incertezze
- 가중치는 아직 공개되지 않았습니다. Apache 2.0 라이선스와 일정('이달 중')은 약속일 뿐입니다. 모든 벤치마크는 회사가 낸 것이며 독립적으로 검증되지 않았고, 'NR' 칸이 많아 비교가 불완전합니다. '연산 3~4배 절감'은 FLOPs 기반의 이론적 추정치이지 비용이나 지연 시간의 실측이 아닙니다. 여러 테스트에서 회사 자체 표가 Beam을 GLM 5.3, Kimi K3, DeepSeek V4.1보다 아래에 둡니다. 100만 토큰 컨텍스트는 미드 트레이닝으로 얻은 것이며 네이티브는 25만 6천입니다. 글에는 작성자 서명이 없습니다.
- Perché pubblicarla
- 서구에서 가장 많은 투자를 받은 스타트업 중 하나(약 47억 달러 조달)가 내놓은 첫 오픈 웨이트 프런티어 모델이고, 정말로 관대한 Apache 2.0 라이선스로 예고됐으며, 오픈 모델을 둘러싼 미중 경쟁이라는 핵심 주제와 맞닿아 있습니다. 엄밀하게 다룰 수 있습니다. 회사의 표 자체가 Beam이 뒤처지는 지점도 보여주고, 가중치는 아직 없습니다. 이전 기사에서 다루지 않은 주제입니다.