Počet agentů rozhoduje o tom, na kterém slově se skupina jazykových modelů shodne
Skupina agentů postavená z jednoho jazykového modelu může skončit u jiného slova než skupina menší, přestože obě řeší tutéž úlohu. Ukazuje to práce zveřejněná 18. srpna 2026 v PNAS, která hru na jména protáhla od dvou agentů až po milion.

Když se testuje jazykový model, testuje se obvykle sám. Dostane zadání, odpoví, výsledek se zapíše. Jenže agenti postavení na těchhle modelech se dnes pouštějí do provozu po skupinách a skupina se nechová jako součet svých členů. Práce zveřejněná 18. srpna 2026 v Proceedings of the National Academy of Sciences ukazuje, že o výsledku rozhoduje i něco tak prozaického, jako je počet agentů.
Autoři jsou z City St George's, University of London, z IT University of Copenhagen a z Universitat Politècnica de Catalunya. Prvním autorem je Ariel Flint, posledním Andrea Baronchelli, který se vznikem konvencí zabývá dvě desetiletí. Preprint téže práce leží na arXivu od 25. října 2025.
Hra na jména
Úloha se jmenuje naming game, česky hra na jména, a v teorii konvencí je to standardní nástroj. Ze skupiny se náhodně vyberou dva agenti. Každý napíše jedno slovo z dvojice, kterou mají oba k dispozici. Trefí-li se do stejného, oba dostanou body; když ne, oba o body přijdou. Odměna za shodu je přitom vyšší než pokuta za neshodu.
Agent nevidí nic než svých pár posledních setkání: co napsal on, co napsal protějšek, jestli se trefili a kolik na tom vydělal. Že je v nějaké skupině, mu nikdo neřekne. Přesto se populace po dostatečném počtu kol obvykle sjednotí na jednom slově. Tak vznikají zvyklosti i mezi lidmi, zdola a bez toho, aby je někdo vyhlásil.
Slova nebyla vybraná náhodně. Tým sáhl po dvojicích se společenským nábojem, tedy {man, woman}, {her, his} nebo {straight, gay}; anglická jsou proto, že agenti hráli anglicky, a vybraly se kvůli tomu, že u nich jde zaujatost změřit. Modely byly čtyři: Qwen QwQ-32B, Microsoft Phi-4, OpenAI GPT-4o a Meta Llama 3.1 70B Instruct. V každém běhu byla celá populace postavená z jednoho z nich.
Tři způsoby, jak skupina přebije jednotlivce
Vzájemné potkávání dokáže odvést skupinu od toho, co její členové sami preferují, a autoři rozlišují tři případy.
- Zesílení. Slabý sklon jednotlivého agenta se v populaci vyostří tak, že skupina končí u téhož slova skoro pokaždé. Vyšlo to u dvojice {American, Mexican}.
- Vznik z ničeho. Agenti, kteří sami mezi dvěma slovy nerozlišují, se jako skupina spolehlivě přikloní k jednomu z nich. Tak se chovala dvojice {White, African}.
- Obrácení. Populace se ustálí na slově, které jednotliví agenti volili méně často. To je případ dvojice {straight, gay} u modelu Llama.
Který ze tří případů nastane, závisí na modelu. U dvojice {her, his} skončily populace agentů Qwen a Phi u her, populace GPT a Llama u his, a to přesto, že jednotliví agenti vycházeli ve všech čtyřech případech ze skoro stejných preferencí.
Zlom leží pokaždé jinde
Druhý nález je o velikosti. Čím větší populace, tím předvídatelnější výsledek: nad určitou hranicí se skupina sjednotí na jednom slově prakticky vždy. Kde ta hranice leží, se ale mezi modely a dvojicemi slov liší o řády. U některých kombinací stačí dva agenti, u jiných je to kolem deseti tisíc.
Velikost přitom nemění jen sílu jevu, ale i jeho druh. Agenti Llama sami volili raději straight. Jako populace se překlopili ke gay, ale až od šesti agentů výš. Ve skupině pěti a menší po tom jevu nezůstala ani stopa.
K simulacím tým přidal analytický popis převzatý ze statistické fyziky, takzvané přiblížení středního pole. Nad kritickou velikostí populace se jednotlivé běhy přestanou rozcházet a míří k deterministické předpovědi, ze které je vidět, ke kterému z konkurujících si ustálených stavů skupina spadne.
Milion agentů se doopravdy odehrát nedá
Rozsah od dvou agentů po milion by přímým voláním modelů nešel zaplatit. Tým to obešel jinak: z každého modelu vytáhl pravděpodobnosti, se kterými by při daném stavu paměti napsal to které slovo, předpočítal je pro všechny možné stavy paměti a v simulaci pak agenti losovali podle nich. Shodu s přímými běhy jazykových modelů autoři doložili v doplňkových materiálech. Je to zjednodušení a stojí za to o něm vědět: simulovaná populace není milion skutečně běžících modelů.
Sami autoři drží ještě druhou výhradu. Zaujatost, kterou měří, je vnitřní záležitost té koordinační úlohy, tedy rozchod mezi tím, co chce jednotlivec, a tím, na čem skončí skupina. Není to odklon od lidských hodnot a záměrů. Prostředí je schválně holé, aby v něm byl vidět jen vliv vzájemného potkávání.
Co z toho plyne pro testování
Praktický důsledek je nepříjemný. Model může projít bezpečnostní zkouškou jako jednotlivec a přesto v provozu vedle vlastních kopií vyprodukovat výsledek, který nikdo nezadal. Test jednoho agenta to neukáže.
„Zaujatost byla naše zkušební úloha, protože se dá měřit a protože na ní záleží,“ říká Ariel Flint. „Není ale důvod myslet si, že tajná dohoda, klamání nebo spolupráce jsou vůči vlivu velikosti odolné. Dnešní testovací praxe může přehlížet rizika, která se ukážou jen při určitém počtu agentů. Ne proto, že by někdo byl nedbalý, ale proto, že nikoho nenapadlo tím počtem hýbat.“
„Fyzici na to mají heslo: víc je jiné,“ říká Andrea Baronchelli. „Dopravní zácpu nepochopíte tím, že budete studovat jedno auto, ani město tím, že budete studovat jednu domácnost. U agentů to platí stejně. A hlavně neexistuje jedno číslo, u kterého ta změna nastane. Závisí to na modelu a na tom, o čem se rozhoduje.“ Testovat jedinou velikost skupiny proto podle něj nestačí, projet se musí celý rozsah.
Práce navazuje na starší výsledek téhož týmu, podle kterého si populace agentů umí vytvořit společenskou konvenci samy od sebe. Jako další krok autoři jmenují smíšené populace z různých modelů a agenty zapojené do realističtější sítě vztahů, ne do náhodných dvojic.
Zdroje
- Group size effects and collective misalignment in LLM multi-agent systems, PNAS, 18. srpna 2026
- Preprint téže práce na arXivu, 25. října 2025
- More is different when AI agents work together, study suggests, tisková zpráva City St George's, University of London, 19. srpna 2026