Přeskočit na obsah
Tech-Blog Chatujme.cz Chatujme.cz
Umělá inteligence

Beta PAIR od Nvidie rozděluje dotazy na jazykové modely mezi počítače v domácí síti

Nvidia na veletrhu IFA v Berlíně představila Personal AI Router, zkráceně PAIR: otevřený program, který si na domácí síti najde počítače s grafikami GeForce RTX, stanice DGX Spark i Macy s čipy M4 a každý dotaz na lokální jazykový model pošle na ten, který má zrovna volno. Jeden model neběží na víc strojích naráz, dělí se jen fronta dotazů, takže nejvíc to pomůže agentům, kteří práci rozkládají na dílčí úkoly.

· 143 zhlédnutí

Malé stolní PC s grafikou GeForce RTX 5070 vedle stanice Nvidia DGX Spark
Dva stroje, které PAIR umí spojit: malé stolní PC s grafikou GeForce RTX 5070 a vedle něj stanice DGX Spark. Foto: Daniel Lu, Wikimedia Commons (CC BY-SA 4.0)

Nvidia 3. září, den před otevřením berlínského veletrhu IFA, zveřejnila betu programu Personal AI Router, zkráceně PAIR. Přes jméno nejde o žádnou krabičku: je to software, který se nainstaluje na každý počítač v domácnosti a dotazy na lokálně běžící jazykové modely rozděluje mezi ně. Zdrojový kód leží na GitHubu pod licencí Apache 2.0, instalátory jsou pro Windows 11, Linux v podobě balíčku .deb a macOS. Repozitář vznikl 2. července a první dvě vydání, 0.1.0 a 0.1.1, na něm visí od 26. a 28. srpna, tedy týden před oficiálním oznámením.

Router sedí na portu Ollamy a agent si ničeho nevšimne

PAIR sám žádný model nespouští. Na každém zapojeném stroji musí běžet Ollama nebo LM Studio, dva rozšířené programy pro lokální jazykové modely, a PAIR jim umí obě věci sám nainstalovat a stáhnout k nim modely. Pak si vezme port, na kterém Ollama nebo LM Studio normálně poslouchají, a tváří se jako ony: nabízí rozhraní shodné s Ollamou i s API OpenAI. Agent nebo aplikace tak posílá dotazy tam, kam je posílala doposud, a nemusí o clusteru vůbec vědět.

Každý příchozí dotaz PAIR přečte, zjistí, který engine a který model žádá, a vybere jeden vhodný stroj. Rozhoduje podle toho, jestli je stroj online, jestli má engine zapnutý a přesně ten model stažený, kolik má rozdělaných úloh a jak je zrovna vytížená grafika, třeba hrou. Dotaz pak celý proběhne na vybraném stroji a odpověď se vrátí stejným rozhraním zpět. Stroje se hledají přes mDNS, tedy stejným ohlašováním na místní síti, jaké používají tiskárny; jde je přidat i ručně podle IP adresy. Párování potvrzuje šestimístný kód a další provoz jde přes mTLS, tedy šifrované spojení, kde se oba konce prokazují certifikátem. Podle Nvidie zůstávají dotazy i odpovědi na domácí síti, pokud jsou na ní i všechny modely a klienti.

Paměť grafik se nesčítá

Nvidia sama v článku na vývojářském blogu vyjmenovává, co PAIR nedělá: neslučuje grafiky do jedné větší, nesčítá jejich paměť, nerozřezává model mezi stroje a jeden dotaz nikdy neběží na víc počítačích naráz. Model se musí vejít do paměti každého stroje, který ho má obsluhovat, a různé stroje mohou mít různé modely. Program tedy nepomůže tomu, kdo chce spustit model větší, než jaký se mu vejde na jednu kartu. Pomůže tam, kde je dotazů hodně najednou: agent, který si úkol rozdělí mezi pět podřízených agentů, vyrobí desítky nezávislých volání modelu, a ta se jinak řadí do fronty na jedné grafice. Sekvenční práce, kde jeden dlouhý dotaz čeká na druhý, podle Nvidie mnoho nezíská.

Jediná čísla, která firma zveřejnila, pocházejí z ukázky s agentem Hermes od Nous Research a modelem Qwen 3.6 35B A3B. Úloha s pěti podřízenými agenty trvala na jediném notebooku RTX Spark v průměru 18 minut; na trojici strojů, tedy notebooku RTX Spark, stanici DGX Spark a počítači s GeForce RTX 5090, 8 minut a 48 sekund. Nvidia u toho výslovně píše, že jde o neoficiální ukázku na jedné sestavě, ne o obecné měření, a že se výsledek mění s modelem, sítí i s tím, kolik strojů je zrovna volných.

Pro koho to je

Podporované jsou grafiky GeForce RTX od řady 20 výš, pracovní karty RTX PRO od architektury Turing, stanice DGX Spark a Macy s čipem M4 nebo novějším. Stránka produktu k tomu chce 8 GB paměti a doporučuje 20 GB místa na disku; mezi platformami vedle Windows 11, DGX OS a macOS Tahoe uvádí i Ubuntu 14.04, tedy vydání z roku 2014, zatímco README na GitHubu mluví jen o balíčku .deb a o překladu ze zdrojáků na ostatních distribucích. Windows na procesorech Arm nese označení experimentální.

Produktový manažer Nvidie Seth Schneider na tiskovém setkání, o kterém píše The Verge, vykreslil domácnost s notebookem RTX Spark a stanicí DGX Spark u otce, notebookem s RTX 5090 u matky, herním počítačem u dcery a MacBookem Pro u syna a spočítal v ní kolem 165 teraflops nevyužitého výkonu. The Verge to označuje za krajní případ; typického uživatele PAIRu si Nvidia představuje s jedním notebookem a jedním herním počítačem. „Je to opravdu poklad tokenů zdarma, které dnes jen tak leží v domácnostech,“ řekl podle The Verge (překlad z angličtiny), a to i po započtení ceny elektřiny v běžné americké domácnosti. V oznámení na firemním blogu Nvidia dodává, že víc než polovina amerických domácností má dva a víc počítačů; odkud to číslo bere, neuvádí.

PAIR byl jen jednou z položek berlínského oznámení. Nvidia zároveň ohlásila, že kompaktní počítače s Windows označené RTX Spark přijdou v říjnu od Lenova a Aceru, a že nové optimalizace v llama.cpp a vLLM zrychlují lokální inferenci na jejích grafikách až 1,9krát. Agenti Perplexity Portable Computer, Hermes Agent a OpenClaw mají dostat zjednodušenou instalaci na Windows s grafikami Nvidia.

Zdroje

Umělá inteligence

NVIDIA jazykové modely Ollama LM Studio IFA 2026

← zpět na výpis