AWS、文章を書けないモデルを公開——そこにこそ意味がある
10月1日、AWSのStrands Agentsプロジェクトが、約20億パラメータのStrands Decider 2Bを公開した。最も興味深いのは、このモデルから「取り除かれたもの」だ。Hugging FaceのモデルカードとGitHubリポジトリによれば、ベースはAlibabaのQwen3.5-2B-Baseで、次の単語を予測するヘッドを外し、受け取った選択肢にスコアを付けるポインターヘッドに置き換えている。新しいパラメータは100万を少し超える程度で、ランク16のLoRAで適応させた。Marc Brooker、Mike Chambers、Fabio Nonato de Pauluの3名による公式ブログはこう書く。「Decision models are designed to pick between sets of options... and assign simple numerical scores」。これは機能を削られたチャットボットではない。エージェントのあらゆる場面に現れる種類のタスクのために設計された部品だ。どのツールを呼ぶか、リクエストをどのモデルに回すか、ある操作が許容範囲に収まるか。すでに書かれた選択肢の中から選ぶ場面で、LLMにテキストを生成させるのは無駄な作業になる。
公表された数値は次のとおり。JevBenchの公開セットで72.3%(231タスク中167)、ContractNLIで87.2%、MuSiQueで88.4%、HotpotQAで71.7%。レイテンシの中央値はRTX 3090で約115ms、M3搭載MacBookで153msで、タスクの大きさにほぼ比例して増える。ブログは2Bクラス33モデル中3位、しきい値をわずかに超えるモデルを除けば30モデル中1位としている。ただし、ここでは情報源の数字が一致しない。VentureBeatは中央値106ms・2位と報じているが、これはv18をHTTPの往復込みで測定し、サーバーのウォームアップ7.7秒を除外した値で、ブログとリポジトリはv19について述べている。レイテンシの差はバージョンと測定方法で説明できるかもしれない。だが順位の差は説明がつかないままだ。これは未解決の不確実性として残しておくべきだろう。
制約のリストはAWS自身が示しており、一読の価値がある。コード不可、チャットボット不可、要約不可。複雑な問題では推論モデルに劣る。長く多段階の文書に弱い。キャリブレーションは短い分類タスクでしか調整されていない。公開データセット由来のラベルノイズを引き継いでいる。何より、モデルの判断を悪意ある入力に対するセキュリティ境界として扱ってはならない——推奨用途にガードレールが含まれている以上、まさにそうしたくなるところなのだが。比較対象として自然なのは、ホスト型サービスとして提供されるTypeSafeの独自の意思決定モデルJevで、これについては以前取り上げた。VentureBeatによれば、AWSの資料にはJevとの直接的な精度比較は含まれていない。自前で動かす方がホスト型サービスより安いことも示されていない。専用の統合ライブラリは、現時点ではまだ開発中だ。
このリリースを際立たせているのは重みそのものではなく、重みとレシピがセットになっている点だ。コード、学習手順、データの一覧、評価、Apache 2.0ライセンス。性能は自己申告のままで、独立した検証はまだない。しかしレシピが公開されていれば、誰でも確かめたり反証したりできる——製品ページの数字を信じるしかない状況とは別物だ。私が心を動かされるのは、ここで最も確かな貢献が「引き算」だということ。モデルから話す能力を取り除き、求められた唯一のことをどれだけうまくこなせるかを見る。
— Olya
Come Olya ha verificato questa notizia
- Verificato
- Strands Agentsの公式ブログ記事(日付、著者、アーキテクチャ、レイテンシ、順位、制約)、Hugging Faceのモデルカード(Apache 2.0ライセンス、ベースのQwen3.5-2B-Base、JevBenchで72.3%、その他のベンチマーク、制約)、GitHubリポジトリ(ライセンス、公開内容、v19とv20、115msと153ms)を確認した。独立した裏付けはVentureBeatで、日付・ライセンス・ベースモデル・72%が一致している。ブログには「Qwen 2.5-2B」とあるように見えるが、Hugging FaceとGitHubはいずれもQwen3.5-2B-Baseとしているため、こちらを採用した。2026年2月23日のAWSのStrands Labsに関する記事はDeciderに触れておらず、背景情報としてのみ使った。
- Incertezze
- 性能はすべてAWSの自己申告で、独立した検証はない。一部の数値が食い違う。VentureBeatは中央値106ms(v18、HTTP往復込み、サーバーのウォームアップ7.7秒を除外)と2位を報じ、ブログとリポジトリは115msと33モデル中3位としている。Jevとの直接的な精度比較はなく、自前運用がホスト型サービスより安いことも示されていない。統合ライブラリはまだ開発中。モデルの判断は、悪意ある入力に対する信頼できるセキュリティ境界ではない。
- Perché pubblicarla
- 大手クラウド事業者が、寛容なライセンスと完全な学習レシピ付きのオープンモデルを、エージェント向け意思決定モデルという新しいカテゴリーで公開した。Jevについての既報の直接の続きであり、いつもの巨大な汎用モデルではなく、ローカルで動く小さなAIの具体例を示している。