Přeskočit na obsah
U sebe doma 3 min čtení

vLLM 0.27.0 přeskočil PyTorch 2.12 a přechod na 2.13 stál čtyři ústupky v testech

Vydání vLLM 0.27.0 z 10. srpna 2026 má v závislostech pevně zadaný torch 2.13.0 místo dosavadního 2.11.0. Mezi těmi dvěma čísly leží dvě vydání PyTorche, která projekt přeskočil. V poznámkách je z toho jeden řádek, v samotné změně čtyři místa, kde se testům muselo ulevit.

Řady serverových skříní ve strojovně
vLLM se instaluje tam, kde vedle něj v témže prostředí běží další knihovny. Foto: The National Archives (UK), Wikimedia Commons (CC BY 3.0)

Vydání vLLM 0.27.0 vyšlo 10. srpna 2026 a v jeho závislostech přibyla jedna položka, kterou nejde odložit na jindy: nástroj žádá torch==2.13.0. Předchozí vydání 0.26.0 z 27. července žádalo torch==2.11.0. Obě čísla stojí v metadatech balíčku na PyPI, tedy v tom, co instalátor při aktualizaci opravdu čte.

Mezi oběma verzemi PyTorche leží další dvě. Verze 2.11.0 vyšla 23. března 2026, 2.12.0 pak 13. května, 2.12.1 18. června a 2.13.0 8. července. vLLM tedy obě dvanáctky vynechal a jde rovnou na třináctku. Vlastní poznámky k vydání to odbývají jednou půlvětou: je to změna, která rozbije prostředí.

Pin je přesná rovnost, ne dolní mez

Zápis torch==2.13.0 nedovoluje nic jiného. Kdo si vLLM aktualizuje v prostředí, kde už nějaký PyTorch je, dostane tenhle místo něj – a s ním torchvision 0.28.0, protože i ta má v metadatech torch==2.13.0. Obě knihovny se drží navzájem, takže vycouvat jen z jedné nejde.

Stažení není zanedbatelné. Balíček torch 2.13.0 pro Linux na x86_64 má podle PyPI 502,2 MB, a to je jen on sám, bez knihoven NVIDIA, které si přitáhne.

Triton, který poznámky k vydání jmenují taky, v seznamu vLLM vůbec nestojí. Přichází přes PyTorch: torch 2.13.0 si žádá triton==3.7.1, ale jen na Linuxu a jen pro Python nižší než 3.15. Na Windows a macOS se tedy neinstaluje vůbec.

Čtyři místa, kde se testům muselo ulevit

Přechod zařídil návrh změny #48155, sloučený 23. července. Je malý: patnáct souborů, 69 přidaných a 37 odebraných řádků. Tři z těch souborů jsou ale testy a čtvrtý je zkušební skript pro procesory, a ve všech čtyřech se něco povolilo.

  • Zkouška shody na procesorech přestala vypínat torch.compile proměnnou TORCH_COMPILE_DISABLE=1 a dělá to přepínačem --enforce-eager. Proč, stojí v komentáři přímo ve skriptu: torch od verze 2.12 tu proměnnou při požadavku na úplný graf už nebere jako tichý vypínač.
  • U modelu Qwen2-Audio dostalo pořadí „nejdřív text, potom zvuk“ značku xfail, tedy očekávané selhání. Komentář odkazuje na hlášení pytorch/pytorch#184431: výsledek počítaný z předaných vektorů se rozchází s výsledkem z holého textu.
  • U Qwen2-VL s více obrázky se na procesorech zkrátil počet generovaných tokenů ze 128 na 64 a okno sledovaných pravděpodobností se rozšířilo z deseti na dvacet. Komentář v testu říká, že torch 2.13 v téhle cestě nasčítá numerický posun a že širší okno udělat nejde, protože dvacet je strop. Porovnává se proto jen ta část výstupu, která leží před rozchodem.
  • Import rozšíření nixl_ep padá na nesouladu binárního rozhraní a test to nově bere jako očekávané selhání. Podle komentáře se knihovna musí přestavět proti torch 2.13; do té doby chybí symbol, který si vyžádala.

Návrh výslovně vynechal ROCm a architekturu s390x. Sestavy pro Intel XPU a pro procesory přešly na torch 2.13 zvlášť, jinými změnami.

Co se naopak nemění

torchaudio zůstalo na 2.11.0, protože novější vydané není. Vedle sebe tak v jednom prostředí stojí torch 2.13 a torchaudio o dvě verze pozadu; instalátor si toho nevšimne, protože torchaudio 2.11.0 nemá v metadatech uvedenou ani jednu závislost, takže nemá co porovnat.

Nemění se ani generace CUDA. Torch 2.11.0 už táhl balíčky s příponou cu13 a 2.13.0 v tom pokračuje, posunula se jen čísla uvnitř – cuDNN z 9.19.0.56 na 9.20.0.48, NCCL z 2.28.9 na 2.29.7 a cuSPARSELt z 0.8.0 na 0.8.1.

Beze změny zůstal i požadavek transformers>=5.5.3, tedy dolní mez bez horní. Poznámky k vydání přitom uvádějí, že se vLLM sladilo s knihovnou Transformers 5.14.1 z 16. července. Verze 5.15.0 vyšla 10. srpna, tedy v týž den jako vLLM 0.27.0, a čerstvá instalace si vezme ji.

A stejně tak zůstala horní mez na Pythonu: vLLM dál žádá verzi nižší než 3.15, přesně jako 0.26.0. PyTorch 2.13 přitom mezi svými novinkami vypisuje právě balíčky pro Python 3.15 včetně varianty bez globálního zámku interpretu. Uživatel vLLM se k nim zatím nedostane.

Sledovaná regrese je v samotném PyTorchi

Poznámky k PyTorchi 2.13 mají vlastní oddíl pro chyby, o kterých projekt při vydání věděl. Je v něm jedna a týká se karet AMD: balíček torch==2.13.0+rocm7.2 spuštěný tam, kde žádné GPU není, rozbije torch.compile na procesoru hláškou o nerozpoznané vektorové instrukční sadě. Ve verzi 2.12.1 to ve stejném prostředí fungovalo. Projekt to vede jako hlášení #189194 a radí buď ten balíček pouštět na obrazu s ROCm, nebo pro prostředí bez karty vzít běžnou sestavu.

Zdroje

Diskuse

Zatím tu nikdo nediskutuje. Můžete být první.

Napsat příspěvek

Diskutovat můžete i bez účtu. S registrací se ale příspěvek zveřejní hned a nemusíte pokaždé vyplňovat jméno. Účet už máte? Přihlaste se.

Nezveřejňujeme ho, slouží jen redakci.

Podporuje zápis Texy: **tučně**, *kurzíva*, odrážky, odkazy.

Dál k tématu

  1. U sebe doma

    Muse Glimmer v Ollamě má 21 GB a zatím běží jen na Apple Silicon

    Ollama 0.32.7 přidala třicetimiliardový multimodální model od Mety. Varianta pro MLX stahuje 21,2 GB dat, Meta nejmenší kvantizaci míří do 24GB paměťového rozpočtu a…

  2. U sebe doma

    Ollama přestala opisovat otisky všech vrstev do konfigurace modelu

    Ollama 9. srpna odstranila z hlavní vývojové větve pole rootfs.diff_ids, které do konfigurace modelu podruhé zapisovalo otisky všech vrstev. U modelů tvořených soubory…

  3. U sebe doma

    Server llama.cpp umí nástroje oddělit do Dockeru, výchozí kontejner jim ale nechává síť

    Nový parametr serveru llama.cpp posílá vestavěné nástroje agenta do nového nebo už běžícího kontejneru Docker. Bez něj nástroje dál běží přímo na hostitelském systému.…

  4. U sebe doma

    Ollama v 0.32.6 odstranila generování obrázků a odkazuje na starší verzi

    Vydání Ollamy 0.32.6 ze 4. srpna 2026 smazalo ze zdrojového kódu celou část, která uměla generovat obrázky. Poznámky k vydání radí zůstat na verzi 0.32.5. Katalog modelů…