Databricks otestoval desítky AI modelů na vlastní kódové základně s miliony řádků a rozhodl se nasadit čínský open-source model GLM 5.2 jako primární nástroj pro denní práci vývojářů. Model dosáhl stejné úspěšnosti jako Anthropic Opus 4.8, ale za třetinovou cenu na úkol. Firma zároveň varuje, že veřejné benchmarky neříkají celou pravdu a každá firma by měla testovat modely na vlastním kódu.
Databricks spustil sériu testů na vlastní produkční kódové základně, kde coding agenti řešili skutečné úkoly — od oprav bugů přes refaktoring až po implementaci nových funkcí. GLM 5.2 od čínské společnosti Zhipu AI dosáhl stejné míry úspěšnosti jako Anthropic Claude Opus 4.8, který patří mezi nejdražší dostupné modely. Rozdíl byl v ceně: jeden dokončený úkol stál s GLM 5.2 průměrně 1,28 dolaru, zatímco s Opus 4.8 to bylo 1,94 dolaru.
Jde o výrazně nižší částky než u velkých generativních úkolů, protože coding agenti pracují s menšími kontexty a generují kratší výstupy. Rozdíl ale narůstá při škálování na stovky nebo tisíce úkolů denně. Pro firmu s vlastním vývojářským týmem, který používá AI asistenty při každodenní práci, může jít o desetitisíce dolarů měsíčně.
GLM 5.2 je open-source model dostupný na Hugging Face pod permisivní licencí, což znamená, že firma může spustit vlastní instanci bez nutnosti posílat kód k externímu API. To je pro Databricks klíčový faktor — veškerý proprietární kód zůstává uvnitř infrastruktury a nevystavuje se riziku úniku přes API logování nebo fine-tuning dat třetí strany.
Model má 9 miliard parametrů, což je relativně malá velikost — vejde se na jednu spotřební GPU a běží s latencí srovnatelnou s běžným code completion nástrojem. Databricks potvrdil, že model zvládá kontexty až do 128 000 tokenů, což pokrývá většinu reálných coding úkolů včetně refaktoringu celých modulů.
Databricks při vyhodnocení testů upozornil, že pořadí modelů podle veřejných benchmarků jako HumanEval nebo MBPP se výrazně lišilo od pořadí na vlastní kódové základně. Některé modely, které excelují na akademických úlohách, selhávaly při práci s komplexním produkčním kódem plným legacy závislostí a netriviálních kontextů.
Příklad: model, který dosahoval vysokého skóre na jednoduchých algoritmických úlohách, měl problémy s refaktoringem funkcí zasazených do starších frameworků, kde bylo nutné respektovat specifickou architekturu a existující konvence. Naopak GLM 5.2 prokázal lepší schopnost pracovat s implicitními pravidly a kontextem kódové základny.
Databricks doporučuje firmám, které používají AI coding nástroje, sestavit vlastní testovací sadu z reprezentativních úkolů ze skutečného kódu a porovnávat modely na ní — ne na generických benchmarcích.
Testy ukázaly, že různé modely excelují v různých oblastech. OpenAI o1 byl nejlepší v algoritmicky náročných úlohách vyžadujících vícestupňové uvažování, ale pomalejší a dražší. Claude Sonnet 3.5 byl silný v psaní testů a dokumentace. GLM 5.2 vynikal v rutinních úpravách kódu, refaktoringu a opravách typových chyb — tedy v úkolech, které tvoří většinu denní práce vývojářů.
Databricks proto plánuje používat GLM 5.2 jako výchozí engine pro běžné úkoly a přepínat na dražší modely pouze tam, kde je to nezbytné — například při návrhu architektury nebo složitých optimalizacích. Toto dynamické přepínání má zajistit AI router, který na základě typu úkolu vybere nejefektivnější model.
Databricks nejprve nasadí GLM 5.2 do vlastního vývojového workflow — coding agenti budou dostupní vývojářům přímo v IDE a při code review. Firma plánuje sledovat metriky jako počet přijatých návrhů, čas strávený opravami navržených změn a celková produktivita vývojářů. Teprve po validaci na interním týmu model zpřístupní zákazníkům jako součást Databricks platformy.
Pro externí uživatele půjde o volitelnou alternativu k dosavadním modelům od OpenAI a Anthropic. Databricks poskytne rozhraní, kde si firma může nastavit preference podle nákladů, latence a požadavků na lokální nasazení. GLM 5.2 bude k dispozici jak přes Databricks API, tak jako kontejner pro on-premise nasazení.
Podnikáte a přemýšlíte nad nasazením AI? Nejdříve doporučuji udělat analýzu, tzv. Road Mapu nasazení AI, kde zjistíte, jak by Vám nejvíce AI AGENTI pomohli, aby to mělo okamžitý přínos.
Vypočítáme, kolik můžou vydělat, ušetřit, peněz i času. Cílem je, abyste si uvolnil ruce na strategicky důležité věci, pro rodinu a volný čas. Byznys poběží dále.
AI Agenti fungují jako reální zaměstnanci, ale nikdy nespí, nepotřebují odpočívat, nezapomenou nic z toho, co je naučíte. Zaškolíte je a pak už nemáte žádné starosti. A dokonce nechtějí ani výplatu, jen papají malé množství tokenů, což ale většinou spraví i paušál za 500,- Kč / měsíc za ChatGpt, nebo Claude. Orientačně vyjdou na cca 6.000,- Kč/ měsíc, ale práce většinou udělají i za desítky tisíc a nepotřebují kancelář, ani služební auto. Telefonní číslo ale potřebují, aby mohli reagovat na zprávy a komunikovat ven.

Analýza stojí 4.900,- Kč, ale pro prvních 50 klientů je to nyní na naše náklady.