Přeskočit na obsah
U sebe doma 4 min čtení

vLLM vyřadil Fuyu, Persimmon a první TeleChat kvůli malému využití

Vydání vLLM 0.26.0 z 27. července přestalo podporovat architektury Fuyu, Persimmon a první generaci TeleChatu. Oba návrhy změn uvádějí jako důvod nízké využití, psané pravidlo projektu přitom počítá s odstraněním modelu, který přestal fungovat. V hlavní větvi už čekají další dva.

Plody tomelu japonskeho odrudy Fuyu, jeden rozkrojeny
Plody tomelu japonského odrůdy Fuyu. Modely Persimmon a Fuyu vydala firma Adept AI; proč zvolila jména podle tomelu, ve svých oznámeních neuvádí. Foto: Frank Schulenburg, Wikimedia Commons (CC BY-SA 4.0)

vLLM je server pro provoz jazykových modelů: načte váhy, rozdělí je mezi grafické karty a obsluhuje dotazy. Vydání 0.26.0 z 27. července má v poznámkách oddíl nadepsaný „Deprecations & Removals“ a v něm jedinou odrážku se třemi jmény: TeleChat, Persimmon a Fuyu. Od téhle verze je vLLM nespustí.

Co přesně zmizelo

Za odrážkou stojí dva návrhy změn, oba sloučené 9. července. Návrh 47989 odebral architekturu TeleChatForCausalLM, návrh 48096 pak PersimmonForCausalLMFuyuForCausalLM. Druhý z nich smazal 1 093 řádků kódu ve 14 souborech a 118 přidal.

Týká se to názvů architektur, ne celých značek. TeleChat2 a TeleChat3 vLLM obsluhuje dál, vypadla jen první generace. Persimmon-8B a Fuyu-8B jsou dva modely firmy Adept AI z podzimu 2023; Fuyu je multimodální, tedy bere na vstup obrázek i text.

Důvodem jsou hodiny běhu, ne rozbitý kód

Odůvodnění je u obou návrhů jednou větou. U TeleChatu stojí „Remove TeleChatForCausalLM due to low usage (less than 10 hours in the past 3 months)“, tedy odstranění kvůli nízkému využití, méně než deset hodin za poslední tři měsíce. U Persimmonu a Fuyu jen „Removing the two as they're low in usage“ – odstraňujeme oba, protože se málo používají. Odkud ta čísla jsou, neuvádí ani jeden z nich.

Psané pravidlo projektu zní jinak. Vzniklo v rozpravě 9669 z října 2024 a jeho závěr zapsaný 2. listopadu 2024 mluví o modelu rozbitém: když model nejede s poslední verzí knihovny transformers a vLLM a výrobce se čtyři týdny neozve, model se odstraní. O malém využití v tom závěru není nic. Dokumentace v oddílu „Selective Focus“ slibuje méně pozornosti modelům, které se používají méně často. Méně pozornosti, ne vyřazení.

Psaná pravidla pro rušení funkcí si nedávno dal i protokol MCP, tam ale s nejméně ročním oknem mezi odložením a smazáním. vLLM žádnou takovou lhůtu nemá: mezi sloučením návrhu a vydáním, které model nespustí, uplynulo osmnáct dní.

Počet stažení měří něco jiného

U Fuyu zní malé využití překvapivě. Karta modelu adept/fuyu-8b hlásila 31. července 43 429 stažení za posledních třicet dní a 1 020 označení „líbí se mi“. Persimmon má 6 804 stažení, první TeleChat naopak 24. Tři vyřazené modely, tři nesouměřitelná čísla.

Proč se podle nich vLLM neřídí, je vidět na jiném návrhu. U modelu Plamo2, který z hlavní větve zmizel 24. července, stojí: „Is only downloaded by vLLM CI so the download stats you see on HF are misleading“ – stahuje ho jen průběžná integrace vLLM, takže počty stažení na Hugging Face klamou. Karta pfnet/plamo-2-1b jich přitom uvádí 45 216 za třicet dní.

Vlastní čísla má vLLM odjinud. Sbírá anonymní statistiku, ve které je i pole model_architecture, čas zápisu a příznak, jestli jde o ostrý provoz. Sběr je ve výchozím stavu zapnutý a vypíná se proměnnou VLLM_NO_USAGE_STATS, proměnnou DO_NOT_TRACK nebo souborem ~/.config/vllm/do_not_track. Že těch „méně než deset hodin“ pochází právě odtud, návrh netvrdí. Souhrn sebraných dat vLLM čas od času zveřejňuje; dokumentace odkazuje na přehled za rok 2024.

Fuyu se „open-sourcoval“ pod nekomerční licencí

U Fuyu je ještě jedna věc, kterou počet stažení zakrývá. Adept ho ohlásil 17. října 2023 slovy „We're open-sourcing Fuyu-8B“ a o pár odstavců níž upřesnil „with an open license (CC-BY-NC)“. Licence CC BY-NC 4.0 zakazuje komerční užití, takže definici otevřeného zdroje nesplňuje; karta modelu ji uvádí stejně. Persimmon-8B je proti tomu pod Apache 2.0. Jak se štítek s licencí na Hugging Face rozchází s tím, co v repozitáři opravdu leží, jsme rozebírali u licence OpenMDW.

Kdo model potřebuje, zůstane na starší verzi

Vyřazená architektura se z vLLM neztratí beze stopy. Zůstane v seznamu _PREVIOUSLY_SUPPORTED_MODELS v souboru registry.py spolu s číslem poslední verze, která ji uměla, a pokus o spuštění skončí chybou: model byl podporovaný do verze té a té, dál není, použijte starší vLLM.

Ten seznam má ve vydání 0.26.0 pětatřicet položek, v hlavní větvi už sedmatřicet. Vlastní počítání v témže souboru dává proti tomu 296 názvů architektur, které registr verze 0.26.0 zná. Vedle toho vede vLLM ještě krátký seznam čtyř architektur, u kterých místo chyby odkáže na samostatný zásuvný modul: Bart, MBart a Florence2.

U Fuyu chyba uvádí jako poslední podporovanou verzi 0.25.0. V registru opravného vydání 0.25.1 ze 14. července ta architektura ještě je – návrhy se sloučily 9. července, do opravné verze se ale nedostaly. Kdo tedy Fuyu provozuje, může zůstat o vydání výš, než mu vLLM radí.

Další dva čekají v hlavní větvi

Modely Plamo2 a Ouro z hlavní větve zmizely 24. a 25. července, tedy tři a dva dny před vydáním 0.26.0; v něm ještě jsou. V seznamu vyřazených u nich stojí jako poslední podporovaná verze právě 0.26.0, takže je nespustí až vydání příští. Text odůvodnění je u obou návrhů stejný včetně věty, že model nahradil Plamo3.

Pro provoz z toho plyne jedna praktická věc: soupis toho, co vLLM přestalo umět, se vede v kódu, ne v dokumentaci. V tabulce podporovaných modelů po vyřazených nezůstala ani poznámka. Kdo drží starší model, dozví se o konci až z chyby při startu – nebo z registru, když se do něj podívá dřív.

Zdroje: poznámky k vydání vLLM 0.26.0, návrhy změn 47989, 48096, 49729 a 49786, rozprava 9669 o pravidlech odstraňování modelů, soubor registry.py ve větvi main a ve značkách v0.25.1 a v0.26.0, dokumentace vLLM k podporovaným modelům a ke sběru statistik, karty modelů na Hugging Face a oznámení Fuyu-8B na blogu Adeptu. Počty stažení jsou z rozhraní Hugging Face k 31. červenci 2026.

Diskuse

Zatím tu nikdo nediskutuje. Můžete být první.

Napsat příspěvek

Diskutovat můžete i bez účtu. S registrací se ale příspěvek zveřejní hned a nemusíte pokaždé vyplňovat jméno. Účet už máte? Přihlaste se.

Nezveřejňujeme ho, slouží jen redakci.

Podporuje zápis Texy: **tučně**, *kurzíva*, odrážky, odkazy.

Dál k tématu

  1. U sebe doma

    Kimi K3 se dá stáhnout i v jednobitové verzi. Má pořád 594 GB a chce 610 GB paměti

    Moonshot vydal 27. července váhy modelu Kimi K3 o velikosti 1,56 TB. Firma Unsloth k nim během dvou dnů dodala zmenšené verze; nejmenší má 594 GB a podle jejího…