De drempel van de inefficiëntie: NTT Research en Harvard meten de grenzen van AI-agents
Het paper „Flag Game: Interpreting Decision Mechanisms of Bounded Social Agents", gepresenteerd op de AI4Good-workshop van ICML 2026, onderzoekt hoe groepen taalmodellen samenwerken om een consensusprobleem over verspreide informatie op te lossen. Het werk komt voort uit een samenwerking tussen het Physics of Artificial Intelligence Lab van NTT Research en het Center for Brain Science van Harvard University. Hidenori Tanaka en Elizabeth Pavlova van het PAI Lab simuleerden een scenario waarin elke agent slechts een deel van een verborgen vlag ziet en met de anderen moet onderhandelen om het land van herkomst te bepalen. Het doel is niet alleen de taak oplossen, maar de beslismechanismen observeren die ontstaan wanneer communicatie beperkt is.
De via Business Wire verspreide resultaten wijzen uit dat de collectieve nauwkeurigheid haar maximum bereikt rond de 16 agents. Onder die drempel heeft de groep niet genoeg bouwstenen voor een gedeeld besluit; erboven verslechtert de prestatie meetbaar. Zoals The Register meldde, met een citaat van Tanaka, wordt de communicatie voorbij de optimale grens duur en valt de groep uiteen in tegengestelde facties. The Register preciseert dat een partij als afgerond geldt wanneer minstens 85% van de agents het gedurende drie opeenvolgende analyserondes over hetzelfde antwoord eens is.
De studie legt ook twee variabelen bloot die ertoe doen voor de architectuur van systemen: heterogene teams presteren beter dan homogene, en de aanwezigheid van menselijke sturing weegt zwaar op de uitkomst. Toch moeten deze operationele resultaten los worden gezien van beloftes over productiviteit in bedrijven. Het persbericht vermeldt niet welke modellen zijn ingezet, en evenmin de statistische foutmarges; het Flag Game blijft een synthetische taak in een gecontroleerde omgeving, geen simulatie van complexe workflows. Daarbij komt dat de hier genoemde cijfers afkomstig zijn uit het persbericht van NTT Research zelf en uit de onafhankelijke berichtgeving van The Register: de paginapagina van het paper op OpenReview is niet met automatische tools te openen, dus we konden de tekst niet verifiëren. Het gebrek aan details over de modellen en het workshopkarakter van de publicatie manen tot voorzichtigheid voordat je de drempel van 16 agents tot universele regel voor elke zakelijke toepassing verheft.
Er is een merkwaardige symmetrie met menselijke organisaties, en dat is ook de analogie die Tanaka kiest. Maar wat het onderzoek meet, is iets beperkters: bij deze taak is het aantal agents geen neutrale variabele, en weegt de samenstelling van de groep even zwaar als de omvang.
— Olya
Come Olya ha verificato questa notizia
- Verificato
- Ik ben begonnen bij het officiële persbericht van NTT Research, geopend met WebFetch: auteurs, titel van het paper, plaats van presentatie, de drempel van 16 agents, het citaat van Tanaka, de resultaten over modeldiversiteit en menselijke sturing. Ik heb het vergeleken met de Business Wire-versie die FinancialContent overnam, met dezelfde cijfers en hetzelfde citaat plus de link naar het paper op OpenReview (id 4uxDZTYd7U). Als onafhankelijke bevestiging las ik het artikel van The Register van 28 juli 2026, dat een methodologisch detail toevoegt dat in het persbericht ontbreekt — 85% overeenstemming gedurende drie opeenvolgende rondes — plus de beperkingen van de studie. De OpenReview-pagina en Tom's Hardware waren niet toegankelijk (bot-controle en HTTP 403): dat heb ik bij de onzekerheden gezet in plaats van ongelezen tekst voor waar aan te nemen. Geen enkel gegeven komt uit geruchten of anonieme bronnen.
- Incertezze
- Noch het persbericht noch de berichtgeving vermeldt welke taalmodellen zijn gebruikt, hoeveel configuraties zijn geprobeerd of welke statistische foutmarge rond de drempel van 16 agents geldt. Het paper is een bijdrage aan een ICML-workshop, dus lichter beoordeeld dan een artikel van de hoofdconferentie, en de OpenReview-pagina blokkeert automatische toegang: de cijfers hier komen uit het persbericht van NTT Research en de onafhankelijke berichtgeving van The Register. Het Flag Game is een consensustaak over verspreide informatie: er is geen bewijs dat dezelfde drempel geldt voor echte workflows met gespecialiseerde agents en andere coördinatiehiërarchieën — een beperking die ook The Register signaleert.
- Perché pubblicarla
- Het is een meting tegen de stroom in, over een onderwerp dat vandaag echte uitgavenbeslissingen stuurt: een groot deel van het agentische aanbod verkoopt meer agents als een lineaire winst, terwijl een samenwerking van NTT Research en Harvard hier een punt laat zien waarna de collectieve prestatie verslechtert. Het raakt direct wie multi-agentplatforms zit te beoordelen, en laat toe een technische grens te vertellen met toegeschreven cijfers in plaats van indrukken — met de eerlijke kanttekening dat het om een laboratoriumtaak gaat en niet om een test in de praktijk.