Přeskočit na obsah
U sebe doma 3 min čtení

llama.cpp ohlásil změnu portu serveru z 8080 na 9931, termín neuvedl

Kdo si pouští model doma přes llama-server, najde ve výpisu novou hlášku: výchozí port se má změnit z 8080 na 9931. Kdy k tomu dojde, projekt neuvádí, a v kódu zatím zůstává osmička. Nové číslo je leetspeak zkratky ggml a v registru IANA na rozdíl od portu Ollamy zapsané není.

Pětiportový gigabitový přepínač Netgear s jedním zapojeným červeným a jedním nezapojeným žlutým kabelem
Pětiportový přepínač Netgear. Port, o který jde v tomhle článku, ale žádnou zdířku nemá: je to číslo ve spojení a llama.cpp ho mění z 8080 na 9931. Foto: Simon A. Eugster, Wikimedia Commons (CC BY-SA 3.0)

Kdo si pouští jazykový model doma přes llama-server, dostane od vydání b10240 při startu řádek navíc. Server oznámí, že se jeho výchozí port změní z 8080 na 9931. Hotové to zatím není: ve zdrojovém kódu i v dokumentaci llama.cpp zůstává osmička a hláška mluví o „některém z příštích vydání“, bez data.

Sedm řádků, které to obstarají, se do souboru tools/server/server.cpp dostalo návrhem 26508 3. srpna 2026 v 10.45 UTC. Podmínka se ptá, jestli adresa, na které server poslouchá, končí na :8080; když ano, vypíše se varování a odkaz na ten návrh. Vydání b10240 z téhož dne, o necelých čtyřicet minut později, hlášku už obsahuje. Zní doslova „NOTICE: server default port will be changed to :9931 in a future release“, tedy v překladu, že se výchozí port serveru v některém z příštích vydání změní na 9931.

Číslo 9931 má být zkratka ggml

Nové číslo náhodné není. V popisu návrhu stojí, že 9931 je leetspeak zkratky GGML, tedy jména knihovny, na které llama.cpp stojí. A změna sama je částí většího záměru: llama-server se má z příkazu, který uživatel spustí, když zrovna potřebuje model, stát trvale běžícím procesem.

Popisuje to otevřený záznam 26116 z 25. července 2026. Příkaz llama serve -hf má podle něj spustit nový server jen tehdy, když ještě žádný neběží; jinak použije ten stávající. Modely, které nejsou ve vyrovnávací paměti, si má stáhnout sám. Otázku, na kterém portu má takový server poslouchat, si autor v záznamu položil a rovnou si odpověděl číslem 9931 s poznámkou, že se rovná „ggml“ – právě odtud to číslo je.

Ten příkaz ve vydání b10240 neexistuje. Mezi nástroji projektu žádná taková položka není a ve zdrojových souborech llama-cli se jako podpříkaz nevyskytuje. Záznam zůstává otevřený a jeho autor v něm rovnou napsal, že je práce už někomu přidělená.

Režim směrovače v serveru už funguje

To, na čem má chystaný příkaz stát, hotové je. llama-server se dá spustit v režimu směrovače (router mode): stačí mu nezadat žádný model. Hlavní proces pak podle dokumentace přeposílá každý požadavek té instanci modelu, kterou si klient vyžádá – u dotazů POST polem model v těle, u dotazů GET parametrem v adrese.

Modely bere ze tří míst: z vyrovnávací paměti řízené proměnnou LLAMA_CACHE, z adresáře zadaného přepínačem --models-dir, nebo z konfiguračního souboru INI přes --models-preset. Kolik jich drží načtených naráz, určuje --models-max; výchozí hodnota jsou čtyři a nula znamená bez omezení.

V registru IANA má 8080 jméno, 9931 ne

Ani jedno z těch čísel není libovolné. Port 8080 je v registru jmen služeb a čísel portů, který vede IANA, zapsaný pro TCP i UDP pod jménem http-alt s popisem „HTTP Alternate (see port 80)“.

Číslo 9931 v registru není. Ve strojovém výpisu, který jsem si 3. srpna 2026 stáhl, nemá záznam ani ono, ani žádné z čísel 9926 až 9942; nejbližší obsazené pod ním je 9925. Zapsané číslo přitom neznamená vyhrazené: registr je evidence, ne zámek, a nic nebrání tomu, aby na 9931 poslouchal někdo jiný.

Ve stejném souboru je ale vidět i druhý přístup. Ollama, druhý rozšířený způsob, jak si pustit model u sebe, má svůj port 11434 v registru zapsaný pod jménem ollama s datem 26. září 2025. Pro llama.cpp ani pro ggml v registru žádný záznam není.

Číslo 8080 stojí ve vlastní dokumentaci na šestnácti řádcích

Přechod se dotkne hotových postupů. V README llama-serveru jsem napočítal 21 výskytů čísla 8080 na 16 řádcích: v tabulce přepínačů u --port, v ukázkovém souboru pro Docker Compose, který mapuje 8080:8080, v příkazech docker run i v ukázkách volání přes curl. A to je jen vlastní dokumentace projektu; cizí návody, hotové skripty a pravidla na branách nikdo nespočítá.

Nová hláška má navíc jeden vedlejší účinek. Rozhoduje se podle adresy, na které server poslouchá, ne podle toho, odkud se to číslo vzalo. Vyskočí proto i tomu, kdo si 8080 zadal sám přepínačem --port a na výchozí hodnotě vůbec nestojí.

Kam to míří, je vidět i bez termínu. Trvale běžící proces s vlastním portem, který si modely stahuje a přepíná sám, je přesně tvar, ve kterém funguje Ollama. llama.cpp k témuž dochází po částech: režim směrovače v serveru je hotový, číslo portu se ohlásilo teď a příkaz, který to má spojit dohromady, je zatím jen zadáním.

Diskuse

Zatím tu nikdo nediskutuje. Můžete být první.

Napsat příspěvek

Diskutovat můžete i bez účtu. S registrací se ale příspěvek zveřejní hned a nemusíte pokaždé vyplňovat jméno. Účet už máte? Přihlaste se.

Nezveřejňujeme ho, slouží jen redakci.

Podporuje zápis Texy: **tučně**, *kurzíva*, odrážky, odkazy.

Dál k tématu

  1. U sebe doma

    Nanbeige 4.2 se vejde do telefonu na 2,58 GB, kontext v něm spadl na 4 096 tokenů

    Na Hugging Face přibyl převod čínského modelu Nanbeige 4.2 do formátu běhového prostředí LiteRT-LM: jediný soubor o velikosti 2,58 GB, čtyřbitové váhy a kontext 4 096…

  2. U sebe doma

    Laguna S 2.1 uvádí milion tokenů kontextu, vlastní GGUF od výrobce má 256 tisíc

    Firma poolside vydala 21. července otevřené váhy modelu Laguna S 2.1 se 118 miliardami parametrů a kontextovým oknem 1 048 576 tokenů. Balíčky GGUF, které k němu sama…

  3. U sebe doma

    llama.cpp ve Windows zapíná rychlé jádro na Intel Xe2 a Xe3 od verze 8860

    Vydání b10215 z 31. července zrušilo plošné vypnutí rychlé Walshovy-Hadamardovy transformace na grafikách Intel ve Windows. Na architekturách Xe2 a Xe3 ji povolí až s…

  4. U sebe doma

    llama.cpp umí dvoubitový Q2_0 i na kartách NVIDIA. Ternární model 8B má 2,15 GiB

    Do hlavní větve llama.cpp přibyla 30. července 2026 podpora formátu Q2_0 pro karty NVIDIA, o den později i pro rozhraní SYCL. Formát ukládá váhu do dvou bitů a s jedním…