Přeskočit na obsah
Tech-Blog Chatujme.cz Chatujme.cz
Technologie

Na pečetní písmo připadá 11 328 z 13 007 znaků, které přidal Unicode 18.0

Verze 18.0 standardu Unicode vyšla 16. září 2026 a zvedla počet zakódovaných znaků na 172 808. Většinu přírůstku tvoří malé pečetní písmo z čínské dynastie Čchin. Vedle nových písem se zpřísnila pravidla pro variation selectory, tedy neviditelné znaky, kterými se dá do textu propašovat pokyn pro jazykový model.

· 109 zhlédnutí

Kamenná dlaždice s dvanácti znaky pečetního písma
Dvanáct znaků malého pečetního písma na dlažební cihle z doby dynastie Čchin. Foto: Editor at Large, Wikimedia Commons (CC BY-SA 2.5)

Konsorcium Unicode vydalo 16. září 2026 verzi 18.0 svého standardu. Přibylo 13 007 znaků a celkový počet zakódovaných znaků stoupl na 172 808. Pro srovnání: Unicode 17.0 přidal loni 4 803 znaků.

Tři nová písma, sedm nových bloků

Nová písma jsou podle souhrnné stránky verze tři: písmo Džürčenů, číslovky nejstaršího klínového písma (Proto-Cuneiform) a pečetní písmo. Za většinu toho přírůstku může to poslední: samo přineslo 11 328 ideografických znaků.

Jde o to, čemu se česky říká malé pečetní písmo (siao-čuan), tedy styl z doby dynastie Čchin; konsorcium jeho stáří klade zhruba k roku 200 před naším letopočtem. Blok se ve standardu jmenuje Seal, kdežto kódové tabulky a základní specifikace píšou Small Seal; konsorcium výslovně upozorňuje, že to není chyba k nahlášení. Písmo Džürčenů se používalo na severovýchodě Číny za říše Ťin.

Bloků přibylo sedm. Kromě dvou pro džürčenské znaky a jednoho pro pečetní písmo je to Bengali Supplement, Archaic Cuneiform Numerals, Musical Symbols Supplement a Miscellaneous Symbols and Arrows Extended. Data pro obě velká východoasijská písma popisuje nová příloha UAX #60 a do znakové databáze přibyly soubory JurchenSources.txt a SealSources.txt.

Tři měnové symboly čekaly přes rok na kód

Vedle historických písem přibyly tři měnové symboly: U+20C2 pro maledivskou rufii, U+20C3 pro dirham Spojených arabských emirátů a U+20C4 pro ománský rijál. Všechny tři značky schválily příslušné měnové autority podle oznámení konsorcia už před více než rokem, jenže bez zápisu ve standardu je nikdo nemohl rozumně používat. Teprve teď mají výrobci písem a software na čem stavět.

Devět emodži, devatenáct položek v Emoji 18.0

Nových emodži je ve verzi 18.0 devět. Emojipedia je vypisuje jmenovitě: praskající obličej, palec doleva, palec doprava, monarcha stěhovavý, kyselá okurka, maják, meteor, guma a síťka s držadlem. Souběžně schválená sada Emoji 18.0 jich počítá devatenáct, protože oba palce mají varianty odstínu pleti.

Tři z těch přírůstků rozdělují to, co se dosud tísnilo pod jedním znakem. Okurka a kyselá okurka, kometa a meteor, obecný motýl a monarcha – u všech tří dvojic se výrobci platforem dlouhodobě rozcházeli v tom, co vlastně kreslí. Unicode ale vzhled nepředepisuje, takže jestli se kresby sjednotí, záleží na každé platformě zvlášť.

Na displeje se to dostane s odstupem. Google podle Emojipedie už zveřejnil návrhy v písmech Noto Color Emoji a Noto Emoji; u ostatních jde o odhad, podle kterého přijde WhatsApp a Samsung začátkem roku 2027, Apple v iOS 28 v březnu nebo dubnu a Microsoft ve velké aktualizaci Windows 11 na přelomu léta a podzimu.

Neviditelné znaky se mají zviditelnit

Bezpečnostní změna je schovaná v části o shodě se standardem. Unicode zná takzvané variation selectory – neviditelné znaky, které upřesňují, jakým tvarem se má vykreslit znak před nimi. Protože se nezobrazují, dají se jimi do textu propašovat celé řetězce, které člověk na obrazovce nevidí, ale program ano.

Základní specifikace to teď pojmenovává přímo: útoky typu cross-prompt injection využívají toho, že se znaky s vlastností Default_Ignorable_Code_Point při nepodporovaném použití nevykreslí vůbec, a jako obvyklé nosiče uvádí právě posloupnosti variation selectorů a takzvaných tag characters. Standard proto nově definuje pojem chybně umístěného variation selectoru, zakazuje takový znak interpretovat a doporučuje ho zobrazit viditelně – stejně jako se ukazuje chybějící glyf.

Specifikace k tomu popisuje režim Show Hidden, ve kterém program na požádání ukáže i znaky, které jinak nemají žádný obraz. Je to doporučení, ne povinnost: co se v editorech a v prohlížečích opravdu objeví, ukáže až praxe.

Co budou muset implementace přepsat

Verze 18.0 nepřináší žádný nový algoritmus, zato mění data, na kterých ty stávající stojí. V algoritmu pro zalamování řádků se pravidlo LB12a upravilo tak, aby se nelámalo mezi třídami BA a GL, a měkký spojovník se přeřadil z třídy BA do HH; figure dash a en dash putovaly opačným směrem. Změnilo se i pravidlo GB9c v příloze o segmentaci textu.

Programy, které mají rozsah bloku CJK Unified Ideographs Extension D napsaný natvrdo, si jeho konec musí posunout na U+2B81E. Datový soubor RSIndex.txt přešel na zápis oddělený středníky. Standardizovaných variantních posloupností přibylo sedmnáct pro tahy CJK a deset pro matematické operátory. Souběžně s novou verzí standardu vyšlo pět technických specifikací, které sdílejí jeho repertoár: řazení, bezpečnostní mechanismy, zpracování mezinárodních domén, emodži a rozpoznávání odkazů.

Pro běžného uživatele se dnes nezmění nic – nová písma i emodži se objeví teprve tehdy, až je doplní operační systémy, písma a aplikace. Druhá půlka vydání je adresnější: pravidlo o tom, co se smí nevykreslit, má nově v základní specifikaci bezpečnostní odůvodnění, které jmenuje útok na jazykové modely.

Zdroje: oznámení konsorcia Unicode, souhrn změn ve verzi 18.0.0, kapitola 5 základní specifikace, Emojipedia, Linuxiac.

Technologie

Unicode emodži kódování textu

← zpět na výpis