Přeskočit na obsah
U sebe doma 4 min čtení

Ornith 1.5 nese v repozitáři obrazový kodér, jeho karta uvádí jen generování textu

Tři velikosti modelu Ornith 1.5 vyšly 18. srpna 2026 s obrazovým kodérem, procesorem videa a šablonou rozhovoru, která počítá obrázky. V balíčcích GGUF k nim leží samostatná projekce o zhruba devíti stech megabajtech a llama.cpp si ji při spuštění stáhne sám. Karta modelu i oznámení výrobce popisují Ornith jako model pro generování textu.

Obrazovy snimac CMOS vyjmuty z fotoaparatu
Snímač CMOS z bezzrcadlovky Canon EOS RP. Snímek je ilustrační. Foto: Islander61, Wikimedia Commons (CC BY-SA 4.0)

Tým Ornith vydal 18. srpna 2026 na Hugging Face tři velikosti modelu Ornith 1.5: hustý model o devíti miliardách parametrů a dvě směsi expertů, označené 35B a 397B. Všechny tři mají v hlavičce karty pipeline_tag: text-generation a licenci MIT, jejíž text v repozitářích chybí. Popis na kartě mluví o uvažování, programování a agentních úlohách.

Konfigurace říká něco navíc. V souboru config.json stojí u všech tří velikostí blok vision_config, tedy popis obrazového kodéru, a vedle něj čísla značek pro obraz i video.

Kodér, procesor videa a šablona, která umí počítat obrázky

Architektura se u modelu 35B jmenuje Qwen3_5MoeForConditionalGeneration. Obrazová část má 27 vrstev, vnitřní rozměr 1 152, dlaždici 16 bodů a výstup srovnaný na 2 048, tedy na skrytý rozměr textové části. Vedle vah leží tři soubory, které by u textového modelu neměly co dělat: preprocessor_config.json, processor_config.jsonvideo_preprocessor_config.json. Všechny se hlásí ke třídě Qwen3VLProcessor.

Nejvíc řekne šablona rozhovoru. Soubor chat_template.jinja si vede počitadlo obrázků, obaluje je značkami <|vision_start|><|vision_end|>, umí je očíslovat popiskem „Picture 1:“ a obrázek v systémové zprávě odmítne chybou. Hugging Face si z architektury sám odvodil štítek image-text-to-text a vypisuje ho u všech tří modelů vedle štítku pro text.

Projekce v balíčku GGUF váží devět set megabajtů

Ke každé ze tří velikostí vydal Ornith i repozitář s balíčky GGUF pro llama.cpp. Kromě čtyř kvantizací a nezmenšené verze BF16 v nich leží ještě jeden soubor navíc, pojmenovaný mmproj. To je multimodální projekce, tedy ta část modelu, která z obrázku udělá vstup srozumitelný jazykové části.

Velikosti sedí na bajt: 902 822 240 B u modelu 35B, 921 704 672 B u devítimiliardového a 921 704 800 B u největšího. Zhruba devět set megabajtů v každém případě.

Hlavička toho souboru se dá přečíst bez stahování celku. Stojí v ní general.architecture = clip, general.type = mmproj, clip.has_vision_encoder = true a 27 bloků o rozměru 1 152, tedy tytéž údaje jako v config.json. Pole general.size_label uvádí 447M. Typ projekce je qwen3vl_merger, což je označení, které llama.cpp zná od modelů řady Qwen3-VL a má pro ně v souboru clip-impl.h vlastní položku. Pole general.tags uvnitř téže projekce přitom nese jedinou hodnotu, text-generation.

Kdo spustí server podle návodu, stáhne si projekci taky

Karta modelu radí dva způsoby spuštění doma. Jeden je ollama run hf.co/ornith-ai/Ornith-1.5-35B-A3B-GGUF, druhý llama-server -hf ornith-ai/Ornith-1.5-35B-A3B-GGUF --port 8000 -c 262144. Ani u jednoho není o obrázcích zmínka.

llama.cpp se přitom o projekci postará sám. Nápověda k přepínači --mmproj-autosouboru common/arg.cpp zní: „whether to use multimodal projector file (if available), useful when using -hf“, tedy jestli se má použít soubor s multimodální projekcí, je-li k dispozici, což se hodí právě při stahování z Hugging Face (přeloženo). Výchozí stav je zapnuto a vypíná se protějškem --no-mmproj.

K 21,7 GB kvantizace Q4_K_M tak přiteče ještě těch 903 MB, aniž o ně kdo požádal, a server pak obrázek na vstupu přijme. Kdo o vidění nestojí, ušetří ten soubor jedním přepínačem.

Šestnáct megapixelů a šest minut záznamu

Meze pro vstup stojí v preprocessor_config.json: shortest_edge 65 536 a longest_edge 16 777 216. Navzdory jménům to nejsou délky hran. Obrazový procesor Qwen2VL, ke kterému se ten soubor sám hlásí, je v knihovně Transformers čte jako dolní a horní mez počtu obrazových bodů a ve výchozím stavu má 3 136 a 1 003 520. Ornith horní mez posunul na 16 777 216, tedy zhruba na 16,8 megapixelu.

Kolik z kontextového okna takový obrázek spolkne, se dá dopočítat. Dlaždice je 16 bodů a sousední čtveřice dlaždic se slučuje do jednoho tokenu (spatial_merge_size 2), takže na jeden token připadá 32 × 32 bodů, tedy 1 024. Obrázek na horní mezi zabere 16 384 tokenů, tedy šestnáctinu okna, které má model podle konfigurace k dispozici. Je to vlastní výpočet z těch dvou hodnot, ne měření.

U videa jsou čísla v processor_config.json: dva snímky za sekundu, nejméně čtyři snímky, nejvíc 768. Při dvou snímcích za sekundu to dělá 384 sekund, tedy šest minut a 24 sekund záznamu na jeden vstup.

Jak dobře model vidí, zatím neukázal nikdo

Karta je jinak na čísla štědrá. Vypisuje výsledky z Terminal-Bench 2.1, ze tří sad SWE-bench, z DeepSWE a z dalších, a u každé popisuje podmínky měření. Ani jedna z nich ale nepracuje s obrázky. Oznámení na webu Ornithu popisuje tři velikosti, způsob tréninku a tytéž sady; slovo o obrazu nebo videu v něm nepadne ani jednou.

Zbývá tedy jediný způsob, jak se to dozvědět: pustit model a podat mu obrázek. Soubory k tomu v repozitáři jsou a server si je stáhne sám.

Zdroje

Diskuse

Zatím tu nikdo nediskutuje. Můžete být první.

Napsat příspěvek

Diskutovat můžete i bez účtu. S registrací se ale příspěvek zveřejní hned a nemusíte pokaždé vyplňovat jméno. Účet už máte? Přihlaste se.

Nezveřejňujeme ho, slouží jen redakci.

Podporuje zápis Texy: **tučně**, *kurzíva*, odrážky, odkazy.

Dál k tématu

  1. U sebe doma

    Kalibrační text pro kvantizaci do GGUF se projeví až pod čtyřmi bity na váhu

    Vydavatel kvantizovaných kopií modelů, který na Hugging Face vystupuje jako bartowski, zveřejnil 17. srpna novou kalibrační sadu a měření, které za ní stojí. Nad zhruba…

  2. U sebe doma

    Unsloth Desktop odsune při přetečení kontextu nejstarší část chatu do archivu

    Unsloth vydal 20. srpna 2026 verzi 0.1.801-beta své desktopové aplikace. Dlouhý chat v ní po přetečení kontextového okna nekončí chybou: okno se vyprázdní, starší kola…

  3. U sebe doma

    Ollama 0.32.15 přestala číst metadata GGUF při každém dotazu

    Server Ollamy otevíral soubor GGUF a četl z něj metadata při každém dotazu na chat i generování; autor změny odhaduje tu režii na 300 ms za volání. Verze 0.32.15 z 19.…

  4. U sebe doma

    llama.cpp přidal k nočním sestavením verze 0.1.x, postup je zatím rozdělaný

    llama.cpp má od 17. srpna vedle nočních značek s písmenem b i značky v0.1.0 až v0.1.2. Nová značka vznikne jen tehdy, když se soubory jeho vnitřní kopie knihovny ggml…