vLLM vyřadil Fuyu, Persimmon a první TeleChat kvůli malému využití
Vydání vLLM 0.26.0 z 27. července přestalo podporovat architektury Fuyu, Persimmon a první generaci TeleChatu. Oba návrhy změn uvádějí jako důvod nízké využití, psané pravidlo projektu přitom počítá s odstraněním modelu, který přestal fungovat. V hlavní větvi už čekají další dva.

vLLM je server pro provoz jazykových modelů: načte váhy, rozdělí je mezi grafické karty a obsluhuje dotazy. Vydání 0.26.0 z 27. července má v poznámkách oddíl nadepsaný „Deprecations & Removals“ a v něm jedinou odrážku se třemi jmény: TeleChat, Persimmon a Fuyu. Od téhle verze je vLLM nespustí.
Co přesně zmizelo
Za odrážkou stojí dva návrhy změn, oba sloučené 9. července. Návrh 47989 odebral architekturu TeleChatForCausalLM, návrh 48096 pak PersimmonForCausalLM a FuyuForCausalLM. Druhý z nich smazal 1 093 řádků kódu ve 14 souborech a 118 přidal.
Týká se to názvů architektur, ne celých značek. TeleChat2 a TeleChat3 vLLM obsluhuje dál, vypadla jen první generace. Persimmon-8B a Fuyu-8B jsou dva modely firmy Adept AI z podzimu 2023; Fuyu je multimodální, tedy bere na vstup obrázek i text.
Důvodem jsou hodiny běhu, ne rozbitý kód
Odůvodnění je u obou návrhů jednou větou. U TeleChatu stojí „Remove TeleChatForCausalLM due to low usage (less than 10 hours in the past 3 months)“, tedy odstranění kvůli nízkému využití, méně než deset hodin za poslední tři měsíce. U Persimmonu a Fuyu jen „Removing the two as they're low in usage“ – odstraňujeme oba, protože se málo používají. Odkud ta čísla jsou, neuvádí ani jeden z nich.
Psané pravidlo projektu zní jinak. Vzniklo v rozpravě 9669 z října 2024 a jeho závěr zapsaný 2. listopadu 2024 mluví o modelu rozbitém: když model nejede s poslední verzí knihovny transformers a vLLM a výrobce se čtyři týdny neozve, model se odstraní. O malém využití v tom závěru není nic. Dokumentace v oddílu „Selective Focus“ slibuje méně pozornosti modelům, které se používají méně často. Méně pozornosti, ne vyřazení.
Psaná pravidla pro rušení funkcí si nedávno dal i protokol MCP, tam ale s nejméně ročním oknem mezi odložením a smazáním. vLLM žádnou takovou lhůtu nemá: mezi sloučením návrhu a vydáním, které model nespustí, uplynulo osmnáct dní.
Počet stažení měří něco jiného
U Fuyu zní malé využití překvapivě. Karta modelu adept/fuyu-8b hlásila 31. července 43 429 stažení za posledních třicet dní a 1 020 označení „líbí se mi“. Persimmon má 6 804 stažení, první TeleChat naopak 24. Tři vyřazené modely, tři nesouměřitelná čísla.
Proč se podle nich vLLM neřídí, je vidět na jiném návrhu. U modelu Plamo2, který z hlavní větve zmizel 24. července, stojí: „Is only downloaded by vLLM CI so the download stats you see on HF are misleading“ – stahuje ho jen průběžná integrace vLLM, takže počty stažení na Hugging Face klamou. Karta pfnet/plamo-2-1b jich přitom uvádí 45 216 za třicet dní.
Vlastní čísla má vLLM odjinud. Sbírá anonymní statistiku, ve které je i pole model_architecture, čas zápisu a příznak, jestli jde o ostrý provoz. Sběr je ve výchozím stavu zapnutý a vypíná se proměnnou VLLM_NO_USAGE_STATS, proměnnou DO_NOT_TRACK nebo souborem ~/.config/vllm/do_not_track. Že těch „méně než deset hodin“ pochází právě odtud, návrh netvrdí. Souhrn sebraných dat vLLM čas od času zveřejňuje; dokumentace odkazuje na přehled za rok 2024.
Fuyu se „open-sourcoval“ pod nekomerční licencí
U Fuyu je ještě jedna věc, kterou počet stažení zakrývá. Adept ho ohlásil 17. října 2023 slovy „We're open-sourcing Fuyu-8B“ a o pár odstavců níž upřesnil „with an open license (CC-BY-NC)“. Licence CC BY-NC 4.0 zakazuje komerční užití, takže definici otevřeného zdroje nesplňuje; karta modelu ji uvádí stejně. Persimmon-8B je proti tomu pod Apache 2.0. Jak se štítek s licencí na Hugging Face rozchází s tím, co v repozitáři opravdu leží, jsme rozebírali u licence OpenMDW.
Kdo model potřebuje, zůstane na starší verzi
Vyřazená architektura se z vLLM neztratí beze stopy. Zůstane v seznamu _PREVIOUSLY_SUPPORTED_MODELS v souboru registry.py spolu s číslem poslední verze, která ji uměla, a pokus o spuštění skončí chybou: model byl podporovaný do verze té a té, dál není, použijte starší vLLM.
Ten seznam má ve vydání 0.26.0 pětatřicet položek, v hlavní větvi už sedmatřicet. Vlastní počítání v témže souboru dává proti tomu 296 názvů architektur, které registr verze 0.26.0 zná. Vedle toho vede vLLM ještě krátký seznam čtyř architektur, u kterých místo chyby odkáže na samostatný zásuvný modul: Bart, MBart a Florence2.
U Fuyu chyba uvádí jako poslední podporovanou verzi 0.25.0. V registru opravného vydání 0.25.1 ze 14. července ta architektura ještě je – návrhy se sloučily 9. července, do opravné verze se ale nedostaly. Kdo tedy Fuyu provozuje, může zůstat o vydání výš, než mu vLLM radí.
Další dva čekají v hlavní větvi
Modely Plamo2 a Ouro z hlavní větve zmizely 24. a 25. července, tedy tři a dva dny před vydáním 0.26.0; v něm ještě jsou. V seznamu vyřazených u nich stojí jako poslední podporovaná verze právě 0.26.0, takže je nespustí až vydání příští. Text odůvodnění je u obou návrhů stejný včetně věty, že model nahradil Plamo3.
Pro provoz z toho plyne jedna praktická věc: soupis toho, co vLLM přestalo umět, se vede v kódu, ne v dokumentaci. V tabulce podporovaných modelů po vyřazených nezůstala ani poznámka. Kdo drží starší model, dozví se o konci až z chyby při startu – nebo z registru, když se do něj podívá dřív.
Zdroje: poznámky k vydání vLLM 0.26.0, návrhy změn 47989, 48096, 49729 a 49786, rozprava 9669 o pravidlech odstraňování modelů, soubor registry.py ve větvi main a ve značkách v0.25.1 a v0.26.0, dokumentace vLLM k podporovaným modelům a ke sběru statistik, karty modelů na Hugging Face a oznámení Fuyu-8B na blogu Adeptu. Počty stažení jsou z rozhraní Hugging Face k 31. červenci 2026.