Ornith 1.5 nese v repozitáři obrazový kodér, jeho karta uvádí jen generování textu
Tři velikosti modelu Ornith 1.5 vyšly 18. srpna 2026 s obrazovým kodérem, procesorem videa a šablonou rozhovoru, která počítá obrázky. V balíčcích GGUF k nim leží samostatná projekce o zhruba devíti stech megabajtech a llama.cpp si ji při spuštění stáhne sám. Karta modelu i oznámení výrobce popisují Ornith jako model pro generování textu.

Tým Ornith vydal 18. srpna 2026 na Hugging Face tři velikosti modelu Ornith 1.5: hustý model o devíti miliardách parametrů a dvě směsi expertů, označené 35B a 397B. Všechny tři mají v hlavičce karty pipeline_tag: text-generation a licenci MIT, jejíž text v repozitářích chybí. Popis na kartě mluví o uvažování, programování a agentních úlohách.
Konfigurace říká něco navíc. V souboru config.json stojí u všech tří velikostí blok vision_config, tedy popis obrazového kodéru, a vedle něj čísla značek pro obraz i video.
Kodér, procesor videa a šablona, která umí počítat obrázky
Architektura se u modelu 35B jmenuje Qwen3_5MoeForConditionalGeneration. Obrazová část má 27 vrstev, vnitřní rozměr 1 152, dlaždici 16 bodů a výstup srovnaný na 2 048, tedy na skrytý rozměr textové části. Vedle vah leží tři soubory, které by u textového modelu neměly co dělat: preprocessor_config.json, processor_config.json a video_preprocessor_config.json. Všechny se hlásí ke třídě Qwen3VLProcessor.
Nejvíc řekne šablona rozhovoru. Soubor chat_template.jinja si vede počitadlo obrázků, obaluje je značkami <|vision_start|> a <|vision_end|>, umí je očíslovat popiskem „Picture 1:“ a obrázek v systémové zprávě odmítne chybou. Hugging Face si z architektury sám odvodil štítek image-text-to-text a vypisuje ho u všech tří modelů vedle štítku pro text.
Projekce v balíčku GGUF váží devět set megabajtů
Ke každé ze tří velikostí vydal Ornith i repozitář s balíčky GGUF pro llama.cpp. Kromě čtyř kvantizací a nezmenšené verze BF16 v nich leží ještě jeden soubor navíc, pojmenovaný mmproj. To je multimodální projekce, tedy ta část modelu, která z obrázku udělá vstup srozumitelný jazykové části.
Velikosti sedí na bajt: 902 822 240 B u modelu 35B, 921 704 672 B u devítimiliardového a 921 704 800 B u největšího. Zhruba devět set megabajtů v každém případě.
Hlavička toho souboru se dá přečíst bez stahování celku. Stojí v ní general.architecture = clip, general.type = mmproj, clip.has_vision_encoder = true a 27 bloků o rozměru 1 152, tedy tytéž údaje jako v config.json. Pole general.size_label uvádí 447M. Typ projekce je qwen3vl_merger, což je označení, které llama.cpp zná od modelů řady Qwen3-VL a má pro ně v souboru clip-impl.h vlastní položku. Pole general.tags uvnitř téže projekce přitom nese jedinou hodnotu, text-generation.
Kdo spustí server podle návodu, stáhne si projekci taky
Karta modelu radí dva způsoby spuštění doma. Jeden je ollama run hf.co/ornith-ai/Ornith-1.5-35B-A3B-GGUF, druhý llama-server -hf ornith-ai/Ornith-1.5-35B-A3B-GGUF --port 8000 -c 262144. Ani u jednoho není o obrázcích zmínka.
llama.cpp se přitom o projekci postará sám. Nápověda k přepínači --mmproj-auto v souboru common/arg.cpp zní: „whether to use multimodal projector file (if available), useful when using -hf“, tedy jestli se má použít soubor s multimodální projekcí, je-li k dispozici, což se hodí právě při stahování z Hugging Face (přeloženo). Výchozí stav je zapnuto a vypíná se protějškem --no-mmproj.
K 21,7 GB kvantizace Q4_K_M tak přiteče ještě těch 903 MB, aniž o ně kdo požádal, a server pak obrázek na vstupu přijme. Kdo o vidění nestojí, ušetří ten soubor jedním přepínačem.
Šestnáct megapixelů a šest minut záznamu
Meze pro vstup stojí v preprocessor_config.json: shortest_edge 65 536 a longest_edge 16 777 216. Navzdory jménům to nejsou délky hran. Obrazový procesor Qwen2VL, ke kterému se ten soubor sám hlásí, je v knihovně Transformers čte jako dolní a horní mez počtu obrazových bodů a ve výchozím stavu má 3 136 a 1 003 520. Ornith horní mez posunul na 16 777 216, tedy zhruba na 16,8 megapixelu.
Kolik z kontextového okna takový obrázek spolkne, se dá dopočítat. Dlaždice je 16 bodů a sousední čtveřice dlaždic se slučuje do jednoho tokenu (spatial_merge_size 2), takže na jeden token připadá 32 × 32 bodů, tedy 1 024. Obrázek na horní mezi zabere 16 384 tokenů, tedy šestnáctinu okna, které má model podle konfigurace k dispozici. Je to vlastní výpočet z těch dvou hodnot, ne měření.
U videa jsou čísla v processor_config.json: dva snímky za sekundu, nejméně čtyři snímky, nejvíc 768. Při dvou snímcích za sekundu to dělá 384 sekund, tedy šest minut a 24 sekund záznamu na jeden vstup.
Jak dobře model vidí, zatím neukázal nikdo
Karta je jinak na čísla štědrá. Vypisuje výsledky z Terminal-Bench 2.1, ze tří sad SWE-bench, z DeepSWE a z dalších, a u každé popisuje podmínky měření. Ani jedna z nich ale nepracuje s obrázky. Oznámení na webu Ornithu popisuje tři velikosti, způsob tréninku a tytéž sady; slovo o obrazu nebo videu v něm nepadne ani jednou.
Zbývá tedy jediný způsob, jak se to dozvědět: pustit model a podat mu obrázek. Soubory k tomu v repozitáři jsou a server si je stáhne sám.
Zdroje
- Karta modelu Ornith-1.5-35B-A3B na Hugging Face, včetně souborů
config.json,preprocessor_config.json,processor_config.jsonachat_template.jinja - Repozitář Ornith-1.5-35B-A3B-GGUF se soubory kvantizací a s projekcí
mmproj; velikosti a metadata odečtené 24. srpna 2026 - common/arg.cpp a tools/mtmd/clip-impl.h v llama.cpp
- Obrazový procesor Qwen2VL v knihovně Transformers
- Ornith-1.5: From Self-Scaffolding to Self-Improvement, oznámení výrobce