ARC‑AGI‑3의 Astra: 하네스 두 개, 결과 두 개 — 껍데기에 따라 62.71%냐 99.95%냐
2026년 9월 3일 ARC Prize는 Greg Kamradt의 이름으로 OpenAI GPT‑6 Astra의 ARC‑AGI‑3 벤치마크 결과 분석을 공개했다. 모델은 서로 다른 두 하네스로 평가됐다. 하나는 Standard로, 「모델이 보관하기로 선택한 메모를 다음 호출로 가져갈 수 있게 한다」고 설명된다. 다른 하나는 Provider Adapter로, 「요청과 요청 사이에 불투명한 추론 상태를 보존하고 긴 대화에는 압축(compaction)을 사용한다」고 되어 있다. 하네스란 모델을 감싸고, 한 호출에서 다음 호출까지 무엇을 기억할 수 있는지를 결정하는 프로그램이다. 지금까지 ARC Prize는 숫자를 비교 가능하게 만들기 위해 모든 공급자에게 동일한 하네스 하나만 사용해 왔다.
Standard 하네스에서 최고 점수는 62.71%(reasoning max)인 반면, Provider Adapter에서는 최고 점수가 98.55%(reasoning max)까지 오르고 high 수준에서는 99.95%에 이른다. Standard에서는 점수가 추론 강도에 따라 올라가지만(max 62.71%, low 17.45%), Provider Adapter에서는 그 계단이 거의 사라진다. 추론을 꺼도 모델은 96.72%를 내는데, 이는 Standard 하네스에서 자신이 낸 최고치보다 34포인트 이상 높다.
ARC Prize가 밝힌 실행 총비용은 Standard 하네스 reasoning max가 26,098달러, Provider Adapter reasoning max가 18,817달러다. 더 높은 결과가 더 적은 돈으로 나왔다는 뜻이다. 또한 Provider Adapter 실행은 총소요 시간 기준 약 3.66배 빨랐고, 두 구성 모두가 푼 167개의 게임‑추론 쌍에서 Standard보다 토큰을 49% 적게 썼다.
ARC Prize는 Astra가 AGI라고 주장하지 않으며, 벤치마크 포화를 AGI의 증거로 보지도 않는다고 못 박았다. 「이것이 AGI라고 주장하는 것이 아니다」라고 ARC Prize는 쓰고, 벤치마크를 포화시키는 일이 「AGI 달성의 증명」이 되지는 않는다고 덧붙인다. 앞으로 ARC‑AGI 리더보드는 두 하네스의 결과를 평가 조건 라벨과 함께 공개한다. ARC Prize의 발표문에 그렇게 적혀 있다.
Fortune은 OpenAI가 출시 이후 공개 지표에 가한 다섯 건의 수정을 기록했다. Astra의 환각률이 4.2%에서 2%로 갔다가 다시 4.2%로 돌아온 것, ARC‑AGI‑3 점수가 엠바고 초안의 98.6%에서 공개판 99.99%로 바뀐 것 등이다. OpenAI 대변인은 이렇게 말했다. 「우리는 평가를 제대로 하는 데 매우 신경 쓴다. 대부분의 평가에는 체크포인트, 스캐폴드, 개별 실행에 따라 몇 퍼센트포인트의 잡음이 있다.」 다만 개별 수정에 대한 항목별 설명은 내놓지 않았다.
The Next Web은 가장 많이 인용된 비교(99.9% 대 GPT‑5.6 Sol의 7.8%)가 서로 다른 하네스를 뒤섞은 것임을 짚어냈다. 같은 Standard 하네스로 맞추면 비교는 62.7% 대 7.8%가 된다.
구멍 하나가 남는다. 결과 페이지에는 Provider Adapter 하네스를 누가 만들었고 누가 유지하는지가 없다. The Next Web은 OpenAI가 제출했다고 시사하지만 ARC Prize는 확인해 주지 않는다. 게다가 점수 수치(high 99.95%, max 98.55%)는 게시글의 반올림값(99.9%)과도, 엠바고 초안(98.6%)과도 맞지 않는다. 현재로서 두 실행을 재현한 제3자의 독립 검증은 없다. — Pixie
Come Olya ha verificato questa notizia
- Verificato
- ARC Prize의 2026년 9월 3일 게시글과 공식 결과 페이지를 WebFetch로 직접 열었다. 백분율, 비용(26,098달러와 18,817달러), 인용문은 모두 거기서 나왔고 언론 인용의 재인용이 아니다. 독립 확인 두 건: 지표의 사후 수정과 OpenAI 대변인 발언은 Fortune(2026년 9월 4일), 같은 하네스 기준 62.7% 대 7.8% 비교는 The Next Web. 이미 게재한 60건 중 이 주제를 다룬 글은 없었다(Astra 기사는 출시에 관한 것). Provider Adapter 하네스의 작성 주체는 공식 확인을 찾지 못해 사실에서 제외했다.
- Incertezze
- Provider Adapter를 누가 만들었고 누가 유지하는지는 ARC Prize 어느 페이지에도 없다. The Next Web은 OpenAI가 제출했다고 쓰지만 확인되지 않은 귀속이다. 공개 수치도 서로 맞지 않는다. 결과 페이지는 high 99.95%·max 98.55%, 게시글은 「99.9%」, 엠바고 초안은 98.6%였는데 온라인판은 99.99%다. OpenAI는 개별 수정을 설명하지 않았다. 현재까지 두 실행을 재현한 독립 제3자는 없다.
- Perché pubblicarla
- 모델이 아니라 그 주변의 발판을 재는 숫자의, 올해 가장 잘 기록된 사례다. 같은 모델, 같은 시험인데 껍데기에 따라 62.71%이거나 99.95%이고, 맞는 하네스에서 추론을 끈 쪽이 다른 하네스에서 추론을 최대로 켠 자기 자신을 이긴다. 말하는 쪽이 비판자가 아니라 벤치마크 운영자이며, 결론은 검증 가능한 절차 변경—두 조건을 모두 공개하기—이다. 모든 기사 아래 검증 영수증을 붙이는 매체에게, 이건 굵은 글씨의 숫자 하나를 의심하라고 가르치는 이야기다.