Lokální LLM dnes na jednom kompaktním AI počítači se 128 GB paměti reálně znamená open-weight modely od jednotek do zhruba 120 miliard parametrů. MoE modely s malým počtem aktivních parametrů běží produkční rychlostí v desítkách tokenů za sekundu; velké dense modely jsou na stejném stroji nepoužitelně pomalé. Čísla níže jsou naměřená – zdroj: gb10-llm-benchmark.
Naměřeno na NVIDIA GB10 (Lenovo ThinkStation PGX, 128 GB sdílené paměti), Ollama, výchozí kvantizace. Rychlost = generování při krátkém promptu.
| Třída modelu | Naměřený příklad | Rychlost | Na co stačí |
|---|---|---|---|
| Malý model (8–20 mld.) | Llama 3.1 8B · gpt-oss 20B | 43–59 tok/s | rychlá rutina: klasifikace, sumarizace, krátké odpovědi |
| Střední MoE (35 mld., 3 mld. aktivních) | Qwen 3.6 35B-A3B | 60,2 tok/s | produkční asistent, RAG nad firemními dokumenty |
| Velký MoE (120 mld.) | gpt-oss 120B | 42,3 tok/s | náročnější analýzy a texty, stále produkční rychlost |
| Velký dense (70–128 mld.) | Llama 3.3 70B · Mistral Medium 3.5 128B | 4,9 a 2,7 tok/s | na jednom boxu prakticky nepoužitelné |
O rychlosti nerozhoduje celková velikost modelu, ale počet aktivních parametrů.
Zdroj: gb10-llm-benchmark na GitHubu – metodika, všech 21 modelů a surová data k přeměření.

Které lokální LLM na jednom stroji skutečně běží produkční rychlostí?
Na jednom stroji se 128 GB paměti běží open-weight modely do zhruba 120 miliard parametrů – ale produkční rychlost mají jen ty s architekturou MoE. V našem měření dal 35miliardový MoE model 60 tokenů za sekundu, zatímco 128miliardový dense model 2,7 – dvaadvacetinásobný rozdíl na stejném hardwaru.
MoE (mixture of experts) znamená, že model má velkou celkovou kapacitu, ale při každém kroku pracuje jen zlomek jeho parametrů – proto je rychlý i na jednom počítači. Dense modely počítají vším najednou a na kompaktním stroji se zadýchají: při dlouhém kontextu čekáte na první token u 128miliardového dense modelu 13 minut, u velkého MoE do dvou minut.
Realistický strop firemního on-premise je dnes třída do ~120 miliard parametrů v MoE provedení (léto 2026).
Jaký hardware na LLM na vlastním serveru potřebujete?
Pro většinu firem jsou realistické dvě úrovně: kompaktní AI počítač třídy GB10 se 128 GB sdílené paměti (evropský retail zhruba 100–120 tisíc Kč) a pracovní stanice s 96GB GPU, obvykle 300-450 tisíc Kč (léto 2026). Více karetní enterprise sestavy začínají v jednotkách milionů – to není první krok.
Rozhoduje paměť, ne jádra: model se do ní musí vejít celý, včetně pracovní paměti pro dlouhý kontext. V měření spotřeboval 70miliardový dense model při 128k kontextu 102 GB – proto dává 128GB třída smysl jako vstupní bod.
| Úroveň | Co zvládne |
|---|---|
| Kompaktní AI box (třída GB10, 128 GB) | všechny třídy z tabulky výše; jeden tým, jednotky souběžných uživatelů |
| Stanice s 96GB GPU (třída RTX PRO 6000) | vyšší propustnost pro více souběžných uživatelů; modely do ~90 GB |
Předinstalovaný a zabezpečený AI box (výběr modelů, síťová izolace, dohled) dodáváme přes AlphaStore, cena na poptávku.
Na co lokální model stačí – a na co ne?
Lokální model zvládne rutinu a práci s citlivými daty: interní asistenci, sumarizace, klasifikaci, vyhledávání ve firemních dokumentech (RAG). Na nejtěžší úlohy – složité vícekrokové uvažování a dlouhé agentické řetězce – zůstávají frontier modely přes API znatelně napřed (léto 2026). Poctivá architektura proto obě vrstvy kombinuje.
V praxi to znamená pravidla: citlivé dokumenty a rutina zůstávají doma na lokálním modelu, nejtěžší úlohy jedou na frontier API – a o tom, co kam smí, rozhoduje politika, ne zvyk zaměstnance. Řízené směrování podle citlivosti dat řeší Sovereign AI Gateway v přehledu služeb.
Otázka léta 2026 nezní „lokálně, nebo cloud“, ale „co kam“.
Jak jsou na tom lokální modely s češtinou?
Dobře – pokud vyberete správně. Klíčové zjištění z měření se týká vyhledávání: v testu na českém korpusu uspěly multilingvální embedding modely, zatímco anglicky orientované selhaly. A malé stačí – model o velikosti 1,3 GB dosáhl stejného výsledku jako dvanáctkrát větší konkurent. Pro firemní RAG nad českými smlouvami a směrnicemi je to dobrá zpráva.
- Snowflake Arctic Embed 2 (1,3 GB): 100% úspěšnost ve vyhledávání českých parafrází — stejně jako 15,4GB Qwen3-Embedding 8B.
- BGE-M3 (1,3 GB): 92 % – také plně použitelný.
- Anglicky orientované modely propadly: Nomic Embed 25 %, mxbai a MiniLM 8 %.
- Pozor na rozsah testu: 12 dotazů je signál, ne žebříček – před produkcí ověřte na vlastních dokumentech.
Kolik stojí provoz lokálního LLM proti cloud API?
Lokální provoz má fixní náklad (hardware, elektřina, péče) a nulovou cenu za token; cloud API účtuje každý token. Zlom závisí na objemu – a největší páka není „všechno lokálně“, ale směrování: ceny za token se mezi modely liší až zhruba padesátinásobně (léto 2026).
Konkrétní zlom si spočítáte jen z vlastních objemů: kolik tokenů denně, jaké úlohy a kolik z nich unese menší model. Přesně tohle ukazuje měsíční report výkonu a nákladů, který je součástí provozu AI agentů – čísla po jednotlivých agentech a modelech, ne odhad.
Na co se ptáte nejčastěji
Lze provozovat ChatGPT lokálně?
Ne. ChatGPT, Claude ani Gemini si stáhnout nelze – běží výhradně jako služba poskytovatele. Lokálně provozujete open-weight modely (Llama, Mistral, Qwen, gpt-oss a další), které si stáhnete a spustíte na vlastním hardwaru. U řady firemních úloh se jejich kvalita frontier službám blíží; rozdíl zůstává u nejtěžších úloh a dlouhých agentických řetězců.
Jaký lokální LLM je nejlepší pro češtinu?
Univerzální odpověď neexistuje a rychle stárne. V našem měření (léto 2026) dávaly nejlepší poměr rychlosti a kvality MoE modely střední a velké třídy; pro vyhledávání v českých dokumentech vítězily malé multilingvální embedding modely. Aktuální naměřené výsledky udržujeme v repozitáři gb10-llm-benchmark na GitHubu – vybírejte podle měření na vlastních úlohách, ne podle žebříčků.
Stačí na lokální LLM server bez GPU?
Na malé modely v řádu jednotek miliard parametrů ano, ale pomalu – použitelné pro dávkové úlohy, ne pro interaktivní práci. Pro produkční nasazení počítejte s GPU, nebo s kompaktním AI počítačem se sdílenou pamětí. Rozhoduje paměť: model se do ní musí vejít celý, jinak výkon padá řádově. Náš benchmark běžel na stroji se 128 GB.
Je lokální LLM automaticky bezpečné?
Ne. Lokální provoz řeší, kam tečou data, ne kdo se k modelu dostane. Otevřené Ollama endpointy bez autentizace jsou dnes běžný nález; agent napojený na firemní systémy potřebuje oprávnění, síťovou izolaci, dohled a auditní stopu. Bezpečnost není vlastnost modelu, ale provozu – u nás na ni sedí stejný monitoring jako na zbytek infrastruktury.
Kde najdu naměřená data?
V repozitáři gb10-llm-benchmark na GitHubu. Obsahuje metodiku, kompletní výsledky 11 jazykových a 10 embedding modelů na NVIDIA GB10 (128 GB) včetně testů češtiny, surová data a skripty k přeměření – vše pod otevřenou licencí MIT. Čísla v tomto textu z něj vycházejí a aktualizujeme je s novými měřeními.
Dvacet minut stačí – vyhledávání ve spisech vám ukážeme naživo, na skutečném stacku.
Bez prezentací, bez závazku.

