llama.cpp ohlásil změnu portu serveru z 8080 na 9931, termín neuvedl
Kdo si pouští model doma přes llama-server, najde ve výpisu novou hlášku: výchozí port se má změnit z 8080 na 9931. Kdy k tomu dojde, projekt neuvádí, a v kódu zatím zůstává osmička. Nové číslo je leetspeak zkratky ggml a v registru IANA na rozdíl od portu Ollamy zapsané není.

Kdo si pouští jazykový model doma přes llama-server, dostane od vydání b10240 při startu řádek navíc. Server oznámí, že se jeho výchozí port změní z 8080 na 9931. Hotové to zatím není: ve zdrojovém kódu i v dokumentaci llama.cpp zůstává osmička a hláška mluví o „některém z příštích vydání“, bez data.
Sedm řádků, které to obstarají, se do souboru tools/server/server.cpp dostalo návrhem 26508 3. srpna 2026 v 10.45 UTC. Podmínka se ptá, jestli adresa, na které server poslouchá, končí na :8080; když ano, vypíše se varování a odkaz na ten návrh. Vydání b10240 z téhož dne, o necelých čtyřicet minut později, hlášku už obsahuje. Zní doslova „NOTICE: server default port will be changed to :9931 in a future release“, tedy v překladu, že se výchozí port serveru v některém z příštích vydání změní na 9931.
Číslo 9931 má být zkratka ggml
Nové číslo náhodné není. V popisu návrhu stojí, že 9931 je leetspeak zkratky GGML, tedy jména knihovny, na které llama.cpp stojí. A změna sama je částí většího záměru: llama-server se má z příkazu, který uživatel spustí, když zrovna potřebuje model, stát trvale běžícím procesem.
Popisuje to otevřený záznam 26116 z 25. července 2026. Příkaz llama serve -hf má podle něj spustit nový server jen tehdy, když ještě žádný neběží; jinak použije ten stávající. Modely, které nejsou ve vyrovnávací paměti, si má stáhnout sám. Otázku, na kterém portu má takový server poslouchat, si autor v záznamu položil a rovnou si odpověděl číslem 9931 s poznámkou, že se rovná „ggml“ – právě odtud to číslo je.
Ten příkaz ve vydání b10240 neexistuje. Mezi nástroji projektu žádná taková položka není a ve zdrojových souborech llama-cli se jako podpříkaz nevyskytuje. Záznam zůstává otevřený a jeho autor v něm rovnou napsal, že je práce už někomu přidělená.
Režim směrovače v serveru už funguje
To, na čem má chystaný příkaz stát, hotové je. llama-server se dá spustit v režimu směrovače (router mode): stačí mu nezadat žádný model. Hlavní proces pak podle dokumentace přeposílá každý požadavek té instanci modelu, kterou si klient vyžádá – u dotazů POST polem model v těle, u dotazů GET parametrem v adrese.
Modely bere ze tří míst: z vyrovnávací paměti řízené proměnnou LLAMA_CACHE, z adresáře zadaného přepínačem --models-dir, nebo z konfiguračního souboru INI přes --models-preset. Kolik jich drží načtených naráz, určuje --models-max; výchozí hodnota jsou čtyři a nula znamená bez omezení.
V registru IANA má 8080 jméno, 9931 ne
Ani jedno z těch čísel není libovolné. Port 8080 je v registru jmen služeb a čísel portů, který vede IANA, zapsaný pro TCP i UDP pod jménem http-alt s popisem „HTTP Alternate (see port 80)“.
Číslo 9931 v registru není. Ve strojovém výpisu, který jsem si 3. srpna 2026 stáhl, nemá záznam ani ono, ani žádné z čísel 9926 až 9942; nejbližší obsazené pod ním je 9925. Zapsané číslo přitom neznamená vyhrazené: registr je evidence, ne zámek, a nic nebrání tomu, aby na 9931 poslouchal někdo jiný.
Ve stejném souboru je ale vidět i druhý přístup. Ollama, druhý rozšířený způsob, jak si pustit model u sebe, má svůj port 11434 v registru zapsaný pod jménem ollama s datem 26. září 2025. Pro llama.cpp ani pro ggml v registru žádný záznam není.
Číslo 8080 stojí ve vlastní dokumentaci na šestnácti řádcích
Přechod se dotkne hotových postupů. V README llama-serveru jsem napočítal 21 výskytů čísla 8080 na 16 řádcích: v tabulce přepínačů u --port, v ukázkovém souboru pro Docker Compose, který mapuje 8080:8080, v příkazech docker run i v ukázkách volání přes curl. A to je jen vlastní dokumentace projektu; cizí návody, hotové skripty a pravidla na branách nikdo nespočítá.
Nová hláška má navíc jeden vedlejší účinek. Rozhoduje se podle adresy, na které server poslouchá, ne podle toho, odkud se to číslo vzalo. Vyskočí proto i tomu, kdo si 8080 zadal sám přepínačem --port a na výchozí hodnotě vůbec nestojí.
Kam to míří, je vidět i bez termínu. Trvale běžící proces s vlastním portem, který si modely stahuje a přepíná sám, je přesně tvar, ve kterém funguje Ollama. llama.cpp k témuž dochází po částech: režim směrovače v serveru je hotový, číslo portu se ohlásilo teď a příkaz, který to má spojit dohromady, je zatím jen zadáním.