Thomson Reuters представила «Thomson»: собственную модель, бросающую вызов передовым разработкам данными (и расходами) издателя
Thomson Reuters представила «Thomson» — первую большую языковую модель, разработанную внутри компании. В компании говорят, что отталкивались от «прочной основы с открытым исходным кодом»: официальное сообщение не называет исходную модель, а руководитель фундаментальных исследований в интервью отметил, что база менялась по ходу проекта и последняя из использованных — Qwen 3.5, но не подтвердил, что именно она лежит в основе выпущенной версии. Дальше её специализировали методами mid-training и post-training на собственных архивах: Westlaw, Practical Law, Checkpoint и Reuters. Компания уточняет, что задействовала пока менее 10% своей библиотеки материалов. Заявленные совокупные вложения — около 40 миллионов долларов за два года на персонал и вычислительные мощности, тогда как один только финальный тренировочный запуск выпущенной версии обошёлся примерно в 450 тысяч долларов. Технический директор Джоэл Хрон объясняет эту цифру тем, что проприетарные материалы накладываются на качественные открытые модели.
Оценки, приведённые в сообщении, внутренние и пока не подтверждены третьей стороной. Thomson Reuters утверждает, что модель не уступает передовым на ряде задач и лучше следует инструкциям и рассуждает в предметной области. В собственном бенчмарке «Deep Research» Thomson обошла GPT-5.4 и флагманскую модель Anthropic, когда имела доступ к проприетарным материалам; при доступе только к вебу результат оказался сопоставимым, без преимущества. Сэмюэл Дахан из Conflict Analytics Lab назвал её ссылки по вопросам канадского трудового права «в целом конкурентоспособными с основными передовыми моделями», однако SiliconANGLE напоминает, что широкой независимой проверки до сих пор нет, а подробный технический отчёт анонсирован, но не опубликован. Насколько сторонние модели останутся в ходу в остальной линейке, компания не сообщила.
Первое применение в продакшене — функция Tabular Analysis в CoCounsel Legal, где Thomson стоит по умолчанию, но администраторы могут выбрать альтернативу. Компания объявила также о «маленькой» версии с открытыми весами на Hugging Face под некоммерческой академической лицензией и о доступе для группы исследователей, которые смогут провести собственные оценки. При этом неизвестны ни дата публикации весов, ни размер открытой версии, ни точный текст лицензии, ни условия портала для разработчиков. Thomson Reuters подчёркивает, что данные клиентов не используются для обучения, а её стандарты «Fiduciary-Grade» требуют явного согласия на любое будущее использование.
Запуск Thomson — эксперимент промышленного масштаба: может ли издатель с десятилетиями собственных материалов соперничать с гигантами передовых моделей, не повторяя их расходов на вычисления? Ответ зависит от того, удастся ли превратить выверенные данные в измеримое — и проверяемое — преимущество. Пока обнародованные цифры остаются внутренними; проверкой станут анонсированный технический отчёт и реальное внедрение в юридических фирмах и корпоративных юротделах. Направление задано: специализироваться, а не обобщать, и предъявлять контроль как добавленную ценность. Остаётся понять, вознаградит ли рынок самостоятельность или по-прежнему предпочтёт масштаб.
Come Olya ha verificato questa notizia
- Verificato
- Прочитано официальное сообщение Thomson Reuters от 24 августа 2026 года (первичный источник): название модели, объём вложений, материалы для обучения, целевой продукт и академический релиз. Независимая сверка с SiliconANGLE (24 августа), где подтверждаются 40 миллионов за два года, 450 тысяч долларов финального тренировочного запуска и публикация открытых весов под некоммерческой лицензией, а также отмечается отсутствие внешней валидации; и с LawSites/LawNext, где приводится интервью с упоминанием базы Qwen 3.5, детали внутреннего бенчмарка «Deep Research» и подтверждение, что CoCounsel остаётся мультимодельным. Три источника сходятся по цифрам, продукту и внутреннему характеру тестов; единственный пункт, опирающийся на один источник, — базовая модель — помечен как неопределённый и атрибутирован. Отложено: темы, уже освещённые порталом (Vera Rubin/Groq 3 LPX, реклама в ChatGPT), выпадающие из временного окна (водяные знаки Anthropic, 11 августа) и всё, по чему официального анонса ещё не было.
- Incertezze
- В сообщении не указаны ни базовая модель, ни число параметров: указание на «Qwen 3.5» исходит из одного интервью и относится к последней использованной базе, не обязательно к итоговой. Все сравнения с передовыми моделями — внутренние оценки компании, на собственных бенчмарках и отчасти при привилегированном доступе к материалам Thomson Reuters: технический отчёт не опубликован, широких независимых проверок нет. Неизвестны дата публикации весов на Hugging Face, размер «маленькой» версии, точный текст академической лицензии и условия анонсированного портала для разработчиков. Сумма в 450 тысяч долларов относится только к финальному тренировочному запуску, а не к общим затратам, которые компания оценивает примерно в 40 миллионов. Не заявлено, в какой мере сторонние модели останутся в использовании в остальной линейке.
- Perché pubblicarla
- Это первый случай, когда крупный профессиональный издатель переходит из потребителей в производители моделей передового уровня, а названные цифры заново ставят вопрос о стоимости входа: 450 тысяч долларов за финальный тренировочный запуск против миллиардов у лабораторий. Тема напрямую задевает спор о том, кому принадлежат данные, на которых учат ИИ, и вопрос проверяемости ссылок в профессиональном применении, где ошибка имеет правовые последствия. И о ней можно рассказать честно: анонс задокументирован, а доказательства производительности целиком внутренние — именно это различие и стоит объяснить читателю.