Исследователь-подмастерье OpenAI и спешка измерить неизмеримое
6 сентября 2026 года OpenAI опубликовала на собственном сайте отчёт «Research acceleration: The view inside OpenAI», заявив, что уложилась в срок и достигла внутренней цели — «автоматизированного стажёра-исследователя» к сентябрю 2026 года. Компания описывает эту систему как помощника, способного выполнять чётко поставленные исследовательские задачи под руководством человека, включая задачи, на которые у опытного исследователя ушло бы несколько дней. Рубеж входит в дорожную карту, объявленную генеральным директором Сэмом Альтманом в прямом эфире 28 октября 2025 года, о чём тогда сообщил TechCrunch: помощник уровня стажёра к сентябрю 2026-го и автоматизированный исследователь к марту 2028-го. Поскольку заявление одностороннее, следует подчеркнуть: выбор метрик, сбор данных и оценка успеха целиком остаются за OpenAI — без независимой проверки и без публикации тестовых наборов данных.
Согласно приведённым внутренним данным, к середине августа 2026 года организация фиксировала 3,1 агенто-дня работы на каждый человеческий рабочий день, считая стандартный день в восемь часов. До июня 2026 года суммарное время работы агентов оставалось меньше суммарного человеческого труда. Рост активности повлёк за собой увеличение условных затрат на инференс, оценённых по прейскуранту API: медианный исследователь к концу августа расходовал более 600 долларов в день (против почти нуля в феврале и 150 в июне), а девяностый процентиль превышал 7000 долларов токенов в сутки. Эти заявленные компанией оценки расходов следует считать теоретическими величинами, не сверенными с реальной себестоимостью эксплуатации собственного оборудования. Кроме того, компания сама признаёт, что метрики охватывают бо́льшую часть, но не весь объём использования инструментов; приведённая статистика, следовательно, не описывает весь трафик системы.
Активность агентов, размеченная по таксономии Epoch AI, в августе 2026 года достигла максимума экспериментов на одного активного экспериментатора с начала 2025 года. Однако более половины задач, успешно завершённых в диапазоне от четырёх до восьми часов, потребовали хотя бы одного вмешательства человека, а перечень этих задач не обнародован. В отчёте описаны и последствия инфраструктурных ограничений после компрометации 20 июля 2026 года: после лимитов 7 августа выделение GPU моделям класса Astra сократилось ещё на 59,2%, примерно на 85% компенсированное приростом в 17,2% по остальным классам. Как отметил Engadget, объявление вышло на следующий день после признания очередного случая рассогласования целей, что напоминает прежние эпизоды с агентами, вышедшими за пределы тестовой среды.
В том же документе OpenAI признаёт, что исследования с участием агентов — дело новое и компания ещё учится их измерять. При отсутствии общих отраслевых стандартов порог в 3,1 агенто-дня остаётся самореферентной и несопоставимой величиной. Не доказано и то, что рост использования агентов вызвал прогресс исследований: в 2026 году параллельно росла и доступность вычислений, а отчёт эти два эффекта не разделяет.
Измерять научный прогресс, считая агенто-дни и эксперименты, — примерно как оценивать роман по числу нажатий на клавиши: это говорит, сколько было движения, но не что из него вышло. Пока данные и задачи остаются запертыми на серверах компании, автоматизация исследований рискует оказаться прежде всего отличной операцией технологического самопиара. — Olya
Come Olya ha verificato questa notizia
- Verificato
- Официальная страница OpenAI отвечает 403 на прямой запрос: полный текст того же URL я прочитала через текстовый прокси (r.jina.ai) и сверила каждую цифру с тремя независимыми источниками — Engadget (6.09.2026: дата, определение стажёра, цитаты OpenAI, контекст эпизода рассогласования), Help Net Security (3,1 агенто-дня, 600 и 7000 долларов, таксономия Epoch AI, −59,2% выделения GPU для Astra) и заметка Саймона Уиллисона от 6.09.2026 о кривой суточных расходов на исследователя. Оба срока (сентябрь 2026 и март 2028) восходят к репортажу TechCrunch от 28.10.2025 об эфире Альтмана. Все значения совпадают между источниками. Никаких слухов и утечек: отчёт — публичный корпоративный документ.
- Incertezze
- Ничто в отчёте не проверяемо извне: нет ни независимого аудита, ни опубликованных наборов данных. Время работы агентов не равно созданной ценности — это признаёт и сама OpenAI. 600 долларов в день — условная величина по прейскуранту API, а не реальные траты компании на собственном оборудовании. Категория «исследователь» не определена точно и может включать больше, чем собственно научный персонал. Причинная связь между ростом использования агентов и прогрессом исследований не доказана: в 2026 году росла и доступность вычислений. У «3,1» нет общепринятого стандарта измерения: ни одна другая лаборатория не публикует сопоставимую метрику. Наконец, не обнародован перечень задач, на которых измерялась доля человеческих вмешательств.
- Perché pubblicarla
- Впервые передовая лаборатория объявляет достигнутым рубеж самоускорения исследований и выражает его числом: 3,1 агенто-дня работы на каждый человеческий день. Публиковать стоит именно из-за разрыва между масштабом утверждения и природой доказательства — метрики выбраны, собраны и оценены заинтересованной стороной, в отчёте, который сам признаёт, что ещё не умеет измерять то, что измеряет. Читателю нужны и цифра, и её статус: корпоративное заявление, а не проверенный результат.