DeepSeek zpřístupnil experimentální model, který kromě textu čte i obrázky
DeepSeek přidal do svého rozhraní model, který kromě textu přijímá i obrázky. Jeden snímek stojí nejvýš 384 tokenů, v jednom dotazu jich smí být šest set a ceník zůstal shodný s textovým V4-Flash. Firma mluví o výkonu blízkém Opusu 4.8, v její vlastní tabulce ale nový model vyhrává tři testy z jedenácti.

Čínský DeepSeek přidal 21. srpna 2026 do svého rozhraní model deepseek-v4-flash-vision-exp. Vychází z textového V4-Flash a podle firmy si v čistě textových úlohách vede stejně jako on, navíc ale přijímá obrázky. Týž den vyšla verze 0.1.1 agentního nástroje DeepSeek Harness, která už s modelem počítá.
Architekturu DeepSeek nezveřejnil. OpenRouter, který model nabízí přes jediného poskytovatele, u něj uvádí řídkou směs expertů s 284 miliardami parametrů, z nichž je při dotazu aktivních 13 miliard. Kontextové okno má milion tokenů, výstup nejvýš 384 tisíc.
Tři cesty, jak snímek poslat
Obrázek se posílá jako blok v poli content, tedy ve tvaru, který zavedlo rozhraní OpenAI. Přiložit ho jde třemi způsoby: zakódovaný do base64 přímo v požadavku, odkazem na veřejnou adresu, ze které si ho model stáhne sám, nebo přes Files API, kam se nahraje jednou a dál se na něj odkazuje identifikátorem. Files API je podle DeepSeeku zdarma.
{
"type": "image_url",
"image_url": {"url": "https://example.com/image.jpg", "detail": "low"}
}Pole detail říká, jak se se snímkem naloží. Hodnota low ho před vyhodnocením zmenší na 512×512 px, high i original ho nechají v původní velikosti. Formát se pozná z obsahu souboru, ne z přípony ani z hlášeného typu MIME; projde JPEG, PNG, GIF a WebP.
Limity jsou popsané dost podrobně na to, aby se s nimi dalo počítat dopředu. Tělo požadavku smí mít 48 MiB, jeden snímek 32 MiB při vložení do požadavku a 64 MiB přes Files API. V jednom dotazu jich smí být až šest set. Hrana snímku měří nejvýš 8192 px, jakmile ale požadavek nese patnáct a víc obrázků, strop klesá na 4096 px. Obrázky se přijímají výhradně v uživatelských zprávách; v systémové nebo asistentské vrátí rozhraní chybu 400.
Za obrázek se platí tokeny, nejvýš 384
Snímek se převede na tokeny podle rozměrů a účtuje se spolu s textem. Podstatné je, co se s ním stane předtím. Velké obrázky se zmenší tak, aby počet pixelů odpovídal zhruba formátu 800×800, malé se naopak zvětší. Snímek 2000×2000 proto stojí přesně tolik co snímek 5000×5000 a strop je 384 tokenů za kus. Každý obrázek se počítá zvlášť, sleva za množství žádná není.
Ceník je shodný s textovým V4-Flash. Ve špičce stojí milion vstupních tokenů 0,44 dolaru, při zásahu do vyrovnávací paměti 0,014 dolaru, a milion výstupních 1,32 dolaru. Mimo špičku je to polovina. Špičku má DeepSeek vymezenou hodinami 01:00 až 04:00 a 06:00 až 10:00 UTC.
„Blízko Opusu 4.8“ a co k tomu říká tabulka
K vydání firma napsala, že model posouvá multimodální agentní schopnosti blízko k Opusu 4.8 od Anthropicu. Server The Next Web si tabulku, kterou k tomu DeepSeek zveřejnil, přepočítal: z jedenácti testů nový model tři vyhrává. DeepSWE o 1,3 bodu, Agents' Last Exam o 1,6 a ZeroBench o 1,0. Na osmi zbylých zaostává. U NL2Repo, kde se pracuje v měřítku celého repozitáře, je rozdíl dvanáct bodů, tedy 57,7 proti 69,7.
Většina ostatních výsledků je opravdu těsná. Terminal Bench 2.1 skončil 83,9 ku 85,0, Toolathlon-Verified 75,9 ku 76,2 a Chartography 64,3 ku 65,0. AutomationBench vypovídá spíš o oboru než o souboji: všechny tři porovnávané modely tam skončily v pásmu 25 až 27 bodů.
Proti vlastnímu předchůdci je posun čitelnější, protože čísla textového V4-Flash vydal DeepSeek na konci července. Terminal Bench vzrostl z 82,7 na 83,9, DeepSWE z 54,4 na 59,3 a DSBench-Hard z 59,6 na 63,6. Ze sedmi textových zkoušek klesla jediná, hledání zranitelností Cybergym: ze 76,7 na 75,3.
Poznámka pod tabulkou
Největší skok firma hlásí u ApexBenchu a u Agents' Last Exam. Pod tabulkou k tomu ale sama dodává, že textový V4-Flash v obou zkouškách multimodální části zadání ignoruje. Starší model tam tedy dostal test s obrázky, na které nevidí, a část toho skoku měří právě tohle. DeepSeek to napsal rovnou do tabulky, ne až do odpovědi na dotaz.
Jako souboj se špičkou se srovnání nedá číst ještě z jednoho důvodu. The Next Web upozorňuje, že Opus 4.8 sice Anthropic dál vede jako aktivní model, od 24. července ale existuje novější Opus 5 a s tím novinku nikdo neporovnal. DeepSeek to ostatně netvrdí. Napsal „blízko Opusu 4.8“ a u toho zůstal.
Váhy zatím venku nejsou
Model běží jen na placené vývojářské platformě DeepSeeku a přes OpenRouter. Server SiliconANGLE připomíná, že firma řadu starších modelů uvolnila i ke stažení, u tohohle to zatím neoznámila. Slovo „experimentální“ v názvu navíc naznačuje, jak dlouho se na model dá spoléhat: předchozí V3.2-Exp vyšlo 29. září 2025 a řádné V3.2 po něm přišlo 1. prosince.
Model tedy přečte obrazovku i graf a na většině zkoušek z té tabulky zaostává o jednotky bodů. Rozdíl v ceně je přitom řádový: The Next Web uvádí, že milion slov vyjde u DeepSeeku zhruba na 87 centů proti asi padesáti dolarům u Anthropicu. Největší mezera zůstává u práce v měřítku celého repozitáře, tedy přesně tam, kam agentní nástroje míří.
Zdroje
- DeepSeek: DeepSeek-V4-Flash-Vision-Exp Release, 21. 8. 2026
- DeepSeek API Docs: Vision
- DeepSeek API Docs: Models & Pricing
- DeepSeek API Docs: Change Log
- The Next Web: DeepSeek launches an experimental multimodal model to rival Anthropic
- SiliconANGLE: DeepSeek debuts multimodal language model competitive with Opus 4.8
- OpenRouter: DeepSeek V4 Flash Vision Exp