Lokální LLM ve firmě: co reálně provozovat na jednom serveru (měřeno, léto 2026)

Lokální LLM dnes na jednom kompaktním AI počítači se 128 GB paměti reálně znamená open-weight modely od jednotek do zhruba 120 miliard parametrů. MoE modely s malým počtem aktivních parametrů běží produkční rychlostí v desítkách tokenů za sekundu; velké dense modely jsou na stejném stroji nepoužitelně pomalé. Čísla níže jsou naměřená – zdroj: gb10-llm-benchmark.
Naměřeno na NVIDIA GB10 (Lenovo ThinkStation PGX, 128 GB sdílené paměti), Ollama, výchozí kvantizace. Rychlost = generování při krátkém promptu.
Třída modeluNaměřený příkladRychlostNa co stačí
Malý model (8–20 mld.)Llama 3.1 8B · gpt-oss 20B43–59 tok/srychlá rutina: klasifikace, sumarizace, krátké odpovědi
Střední MoE (35 mld., 3 mld. aktivních)Qwen 3.6 35B-A3B60,2 tok/sprodukční asistent, RAG nad firemními dokumenty
Velký MoE (120 mld.)gpt-oss 120B42,3 tok/snáročnější analýzy a texty, stále produkční rychlost
Velký dense (70–128 mld.)Llama 3.3 70B · Mistral Medium 3.5 128B4,9 a 2,7 tok/sna jednom boxu prakticky nepoužitelné
O rychlosti nerozhoduje celková velikost modelu, ale počet aktivních parametrů.
Zdroj: gb10-llm-benchmark na GitHubu – metodika, všech 21 modelů a surová data k přeměření.

Které lokální LLM na jednom stroji skutečně běží produkční rychlostí?

Na jednom stroji se 128 GB paměti běží open-weight modely do zhruba 120 miliard parametrů – ale produkční rychlost mají jen ty s architekturou MoE. V našem měření dal 35miliardový MoE model 60 tokenů za sekundu, zatímco 128miliardový dense model 2,7 – dvaadvacetinásobný rozdíl na stejném hardwaru.
MoE (mixture of experts) znamená, že model má velkou celkovou kapacitu, ale při každém kroku pracuje jen zlomek jeho parametrů – proto je rychlý i na jednom počítači. Dense modely počítají vším najednou a na kompaktním stroji se zadýchají: při dlouhém kontextu čekáte na první token u 128miliardového dense modelu 13 minut, u velkého MoE do dvou minut.
Realistický strop firemního on-premise je dnes třída do ~120 miliard parametrů v MoE provedení (léto 2026).

Jaký hardware na LLM na vlastním serveru potřebujete?

Pro většinu firem jsou realistické dvě úrovně: kompaktní AI počítač třídy GB10 se 128 GB sdílené paměti (evropský retail zhruba 100–120 tisíc Kč) a pracovní stanice s 96GB GPU, obvykle 300-450 tisíc Kč (léto 2026). Více karetní enterprise sestavy začínají v jednotkách milionů – to není první krok.
Rozhoduje paměť, ne jádra: model se do ní musí vejít celý, včetně pracovní paměti pro dlouhý kontext. V měření spotřeboval 70miliardový dense model při 128k kontextu 102 GB – proto dává 128GB třída smysl jako vstupní bod.
ÚroveňCo zvládne
Kompaktní AI box (třída GB10, 128 GB)všechny třídy z tabulky výše; jeden tým, jednotky souběžných uživatelů
Stanice s 96GB GPU (třída RTX PRO 6000)vyšší propustnost pro více souběžných uživatelů; modely do ~90 GB
Předinstalovaný a zabezpečený AI box (výběr modelů, síťová izolace, dohled) dodáváme přes AlphaStore, cena na poptávku.

Na co lokální model stačí – a na co ne?

Lokální model zvládne rutinu a práci s citlivými daty: interní asistenci, sumarizace, klasifikaci, vyhledávání ve firemních dokumentech (RAG). Na nejtěžší úlohy – složité vícekrokové uvažování a dlouhé agentické řetězce – zůstávají frontier modely přes API znatelně napřed (léto 2026). Poctivá architektura proto obě vrstvy kombinuje.
V praxi to znamená pravidla: citlivé dokumenty a rutina zůstávají doma na lokálním modelu, nejtěžší úlohy jedou na frontier API – a o tom, co kam smí, rozhoduje politika, ne zvyk zaměstnance. Řízené směrování podle citlivosti dat řeší Sovereign AI Gateway v přehledu služeb.
Otázka léta 2026 nezní „lokálně, nebo cloud“, ale „co kam“.

Jak jsou na tom lokální modely s češtinou?

Dobře – pokud vyberete správně. Klíčové zjištění z měření se týká vyhledávání: v testu na českém korpusu uspěly multilingvální embedding modely, zatímco anglicky orientované selhaly. A malé stačí – model o velikosti 1,3 GB dosáhl stejného výsledku jako dvanáctkrát větší konkurent. Pro firemní RAG nad českými smlouvami a směrnicemi je to dobrá zpráva.
  • Snowflake Arctic Embed 2 (1,3 GB): 100% úspěšnost ve vyhledávání českých parafrází — stejně jako 15,4GB Qwen3-Embedding 8B.
  • BGE-M3 (1,3 GB): 92 % – také plně použitelný.
  • Anglicky orientované modely propadly: Nomic Embed 25 %, mxbai a MiniLM 8 %.
  • Pozor na rozsah testu: 12 dotazů je signál, ne žebříček – před produkcí ověřte na vlastních dokumentech.

Kolik stojí provoz lokálního LLM proti cloud API?

Lokální provoz má fixní náklad (hardware, elektřina, péče) a nulovou cenu za token; cloud API účtuje každý token. Zlom závisí na objemu – a největší páka není „všechno lokálně“, ale směrování: ceny za token se mezi modely liší až zhruba padesátinásobně (léto 2026).
Konkrétní zlom si spočítáte jen z vlastních objemů: kolik tokenů denně, jaké úlohy a kolik z nich unese menší model. Přesně tohle ukazuje měsíční report výkonu a nákladů, který je součástí provozu AI agentů – čísla po jednotlivých agentech a modelech, ne odhad.

Na co se ptáte nejčastěji

Lze provozovat ChatGPT lokálně?

Ne. ChatGPT, Claude ani Gemini si stáhnout nelze – běží výhradně jako služba poskytovatele. Lokálně provozujete open-weight modely (Llama, Mistral, Qwen, gpt-oss a další), které si stáhnete a spustíte na vlastním hardwaru. U řady firemních úloh se jejich kvalita frontier službám blíží; rozdíl zůstává u nejtěžších úloh a dlouhých agentických řetězců.
Univerzální odpověď neexistuje a rychle stárne. V našem měření (léto 2026) dávaly nejlepší poměr rychlosti a kvality MoE modely střední a velké třídy; pro vyhledávání v českých dokumentech vítězily malé multilingvální embedding modely. Aktuální naměřené výsledky udržujeme v repozitáři gb10-llm-benchmark na GitHubu – vybírejte podle měření na vlastních úlohách, ne podle žebříčků.
Na malé modely v řádu jednotek miliard parametrů ano, ale pomalu – použitelné pro dávkové úlohy, ne pro interaktivní práci. Pro produkční nasazení počítejte s GPU, nebo s kompaktním AI počítačem se sdílenou pamětí. Rozhoduje paměť: model se do ní musí vejít celý, jinak výkon padá řádově. Náš benchmark běžel na stroji se 128 GB.
Ne. Lokální provoz řeší, kam tečou data, ne kdo se k modelu dostane. Otevřené Ollama endpointy bez autentizace jsou dnes běžný nález; agent napojený na firemní systémy potřebuje oprávnění, síťovou izolaci, dohled a auditní stopu. Bezpečnost není vlastnost modelu, ale provozu – u nás na ni sedí stejný monitoring jako na zbytek infrastruktury.
V repozitáři gb10-llm-benchmark na GitHubu. Obsahuje metodiku, kompletní výsledky 11 jazykových a 10 embedding modelů na NVIDIA GB10 (128 GB) včetně testů češtiny, surová data a skripty k přeměření – vše pod otevřenou licencí MIT. Čísla v tomto textu z něj vycházejí a aktualizujeme je s novými měřeními.

Dvacet minut stačí – vyhledávání ve spisech vám ukážeme naživo, na skutečném stacku.

Bez prezentací, bez závazku.
František Břicháček
František Břicháček

František Břicháček staví a provozuje IT infrastrukturu 30 let, má za sebou 3 implementace ISO 27001 a vlastní produkční stack v datacentru - přes 50 systémů v produkci. Poznámky píše z vlastního provozu a měřených dat. Více na stránce o nás.

Articles: 2
AI a bezpečnost bez balastu
Jednou měsíčně: co se osvědčilo v českých firmách, co si nasadit a čemu se vyhnout. Odhlášení jedním klikem.