OpenAI zveřejnilo platformu Agent RFT, která umožňuje firmám dotrénovat reasoning modely na vlastních nástrojích a interakcích v reálném čase. Místo klasického fine-tuningu na hotových datech zde reinforcement learning upravuje model přímo během práce s API, databázemi nebo interními systémy. Wenjie Zi a Will Hang z OpenAI ukázali, jak enterprise zákazníci eliminují opakované token-loop chyby a zvyšují efektivitu o desítky procent. Jde o posun od obecných modelů k systémům, které rozumí specifickým procesům firmy — nikoliv jen jejímu slovníku.
Agent RFT (Reinforcement Fine-Tuning) pracuje s reward signály přicházejícími z reálných nástrojů. Pokud model volá interní API, systém hodnotí úspěšnost akce — zda vrátilo správná data, jak rychle, jestli bylo nutné opakování. Tyto signály nepřichází až po celé konverzaci, ale průběžně během inference. Model se tak učí přesně tomu, jakou sekvenci kroků zvolit v kontextu konkrétního nástroje, databáze nebo workflow.
Klassický fine-tuning upravuje model na základě statických příkladů: vstup–výstup–label. Agent RFT dává modelu zpětnou vazbu během řešení úlohy. To znamená, že neučíte model „jak správně odpovědět“, ale „jak efektivně projít rozhodovacím stromem nástrojů“. Rozdíl je praktický: místo stovek příkladů s manuálně vytvořenými anotacemi stačí desítky úloh s měřitelným výsledkem.
Presentation zdůrazňuje problém credit assignment — určení, který krok v dlouhé sekvenci akcí vedl k selhání. Pokud model nejprve zavolá špatnou databázi, pak opraví dotaz, ale špatně parsuje výsledek, klasické hodnocení na konci řetězce neukáže, kde se stala chyba. Reinforcement learning s průběžnými signály toto řeší: každý nástroj vrací reward ihned po interakci.
OpenAI ukázalo případ, kdy model opakovaně volal stejné API s drobnými obměnami dotazu — token loop bez efektu. Agent RFT dostal negativní reward za opakování a pozitivní za úspěšné volání s minimem oprav. Po dotrénování klesl průměrný počet volání z osmi na tři, inference zrychlila o 60 procent a chybovost klesla o třetinu. Model se nenaučil „správnou odpověď“, ale strategii, kdy opravit parametr a kdy zkusit jiný nástroj.
Zi a Hang zmínili zákazníka z finančního sektoru, kde model analyzoval transakce a volal interní risk API. Obecný reasoning model často házel neúplné parametry nebo opakoval dotazy při chybějících datech. Po nasazení Agent RFT — s reward signály z API odpovědí a logů — model naučil se doplnit chybějící pole hned při prvním volání a paralelizovat nezávislé dotazy. Výsledkem bylo zkrácení průměrného vyhodnocení transakce ze 4,2 sekundy na 1,8 sekundy a pokles eskalací o 40 procent.
Druhý případ: zdravotnictví, kde model zpracovával požadavky na laboratorní testy a musel zjistit dostupnost, cenu a pojistné krytí přes tři různá API. Původní model volal sekvenčně, často zbytečně opakoval, když jedno API vrátilo partial data. Po reinforcement tuningu s explicitními reward signály za paralelní volání a penalizací za duplicitní dotazy se průměrný čas zpracování snížil z 11 na 5 sekund a chybovost při neúplných datech klesla o polovinu.
Agent RFT nevyžaduje předem připravený dataset tisíců anotovaných příkladů. Stačí definovat reward funkci: co je úspěch (správná odpověď z API, minimální počet volání, dodržení pořadí kroků) a co je penalizace (opakování, timeout, chybný formát). Model pak řeší desítky až stovky reálných úloh, dostává průběžné signály a upravuje strategii inference.
Presentation ukázalo, že typická iterace trvá dny, ne týdny. Firma nastaví reward signály, spustí model na testovacích úlohách (často simulované produkční scénáře), vyhodnotí výsledky a případně upraví penalizace. Po třech až pěti iteracích model stabilně dosahuje lepších výsledků než základní reasoning model bez fine-tuningu. OpenAI zdůraznilo, že reward funkce nemusí být dokonalá — i hrubé signály (úspěch/neúspěch, rychlost) stačí k výraznému zlepšení.
Agent RFT ukazuje posun od univerzálních reasoning modelů k systémům, které rozumí specifickému prostředí. Model se neučí jen „řešit problémy“, ale „řešit problémy našimi nástroji podle našich procesů“. To znamená, že výhoda není v obecné inteligenci, ale v efektivitě konkrétní implementace.
Pro firmy to mění ekonomiku nasazení: místo stovek hodin manuální anotace dat stačí definovat, co je úspěch, a nechat model trénovat na reálných úlohách. Riziko je v tom, že reward funkce může optimalizovat na nesprávnou metriku — například rychlost na úkor přesnosti. Presentation doporučuje začít s několika málo jasnými signály a přidávat další až po stabilizaci základního chování.
Podnikáte a přemýšlíte nad nasazením AI? Nejdříve doporučuji udělat analýzu, tzv. Road Mapu nasazení AI, kde zjistíte, jak by Vám nejvíce AI AGENTI pomohli, aby to mělo okamžitý přínos.
Vypočítáme, kolik můžou vydělat, ušetřit, peněz i času. Cílem je, abyste si uvolnil ruce na strategicky důležité věci, pro rodinu a volný čas. Byznys poběží dále.
AI Agenti fungují jako reální zaměstnanci, ale nikdy nespí, nepotřebují odpočívat, nezapomenou nic z toho, co je naučíte. Zaškolíte je a pak už nemáte žádné starosti. A dokonce nechtějí ani výplatu, jen papají malé množství tokenů, což ale většinou spraví i paušál za 500,- Kč / měsíc za ChatGpt, nebo Claude. Orientačně vyjdou na cca 6.000,- Kč/ měsíc, ale práce většinou udělají i za desítky tisíc a nepotřebují kancelář, ani služební auto. Telefonní číslo ale potřebují, aby mohli reagovat na zprávy a komunikovat ven.

Analýza stojí 4.900,- Kč, ale pro prvních 50 klientů je to nyní na naše náklady.