Vaše AI umí draze předstírat práci. AutoSynthData ji chce naučit skutečně šetřit

Agent oznámil „hotovo“. Databáze měla jiný názor. V testování Microsoftu skončilo 67,24 % neúspěšných pokusů bez závěrečné chyby nástroje, přestože agent provedl nějakou změnu. Výsledek zůstal nesprávný. Úhledná odpověď tedy ještě neznamená odvedenou práci. A účet za opravu samozřejmě přijde člověku. Podrobnosti zveřejnil Microsoft u projektu ThinkingBox.
Vaše AI umí draze předstírat práci. AutoSynthData ji chce naučit skutečně šetřit
ServiceNow CoreAI představilo 2. října 2026 AutoSynthData, postup pro tvorbu trénovacích dat podnikových agentů. Vychází z úloh, ve kterých cílový model selhává a silnější model uspěje. Z těchto rozdílů vytváří nové příklady, ověřuje jejich proveditelnost a připravuje podklady pro další trénování.
Výsledky jsou zajímavé. V prostředí EnterpriseOps Gym Hybrid vzniklo 2 000 syntetických příkladů přibližně za 18 hodin. Dotčený model Gemma-4-26B-A4B-it po dotrénování zlepšil průměrnou úspěšnost Pass@1 o 7,2 procentního bodu, relativně o 35 %. V prostředí ITSM vzrostla stejná metrika z 18,77 % na 27,18 %. Jde o výsledky autorů v konkrétním testovacím prostředí. Zdroj: ServiceNow CoreAI.
Pro firemní rozpočet je podstatná jiná otázka: kolik lidských zásahů díky tomu odpadne? Zlepšení benchmarku nemusí znamenat levnější vyřízení reklamace. Jestli agent ušetří dvě minuty psaní, ale následná kontrola zabere pět, automatizovali jste hlavně vznik práce.
Rozumný cíl proto zní úžeji. Naučit menší model spolehlivě zvládat konkrétní opakující se postup. Třeba dohledat měření, zkontrolovat nesrovnalost a připravit podklad k reklamaci. Právě u takových úloh se dá porovnat kvalita, rychlost i cena jednoho správně dokončeného případu. Velkolepé sliby o digitálním zaměstnanci si zatím nechte do prezentace.
Trénovací příklad musí obsahovat i důkaz
Představme si správce několika fotovoltaických elektráren. Chce agenta, který zpracuje hlášení o chybějících datech. Zadání „vyřeš problém s měřením“ je příliš gumové. Správný výsledek musí být popsaný tak, aby ho dokázal ověřit program.
V našem návrhu má každý příklad počáteční stav databáze, požadavek zákazníka, dostupné nástroje a podmínky úspěchu. Agent například dohledá konkrétní odběrné místo, zjistí chybějící intervaly a založí jediný servisní požadavek. Nesmí přepsat skutečnou spotřebu odhadem ani uzavřít případ bez doplněných podkladů.
První sadu bych sestavil ze třiceti ručně zkontrolovaných situací. Patřil by do ní výpadek komunikace, duplicitní hlášení, chybný identifikátor měřidla a požadavek člověka, který k zařízení nemá přístup. Teprve potom bych nechal model vyrábět další varianty.
Praktické rozšíření spočívá ve změně okolností. Stejná chyba může nastat na jiné provozovně, po změně měřidla nebo během přechodu času. Pouhé přepsání jmen a částek vytváří objem, nikoli pestrost.
Každý uložený příklad by měl nést také verzi pravidel, datum vytvoření a výsledek kontroly. Jinak za tři měsíce nepoznáte, zda se model pokazil, nebo se změnil proces. Soubor s tisíci dialogů bez původu připomíná účetnictví v krabici od bot. Něco v něm určitě je. Auditora to ale nepotěší.
Chcete ušetřit na energiích?
Zjistěte, kolik můžete ušetřit sdílením elektřiny z FVE nebo optimalizací bateriového úložiště.
Spočítat úsporu →První prototyp rozjedete přes Ollamu
Pro vlastní zjednodušený experiment lze použít otevřený software: Ollamu pro spouštění modelu, PostgreSQL jako zkušební databázi a Python pro řízení pokusů. Následující ukázka je samostatný prototyp inspirovaný tématem, nikoli instalační postup AutoSynthData.
Po instalaci a spuštění Ollamy stáhnete například model Qwen3 s osmi miliardami parametrů:
```bash ollama pull qwen3:8b ```
Potom požádáte místní rozhraní o návrh testovací situace:
```bash curl http://localhost:11434/api/generate \ -H 'Content-Type: application/json' \ -d '{ "model": "qwen3:8b", "stream": false, "format": "json", "prompt": "Vrať JSON s klíči zadání, počáteční_stav a očekávaný_stav. Navrhni fiktivní servisní případ chybějícího měření FVE. Nevytvářej osobní údaje." }' ```
Výstup je návrh. Člověk musí nejprve ověřit, zda situace dává smysl a očekávané řešení odpovídá firemním pravidlům. U větší dávky přidejte přesné schéma JSON s povinnými položkami a typy. Ollama podporuje strukturované výstupy podle schématu, ale správný formát ještě nepotvrzuje správnost obsahu. Dokumentace Ollamy.
Pro orientaci: osm miliard parametrů při čtyřech bitech představuje teoreticky asi 4 GB samotných vah. Skutečný provoz potřebuje další paměť na režii a kontext. Počítač se 16–32 GB RAM je rozumný výchozí bod pro menší experiment, rychlost však závisí na konkrétní konfiguraci. Před nákupem grafiky změřte svůj pracovní postup.
Na první víkend nepotřebujete serverovnu. Potřebujete deset dobrých případů a jistotu, že poznáte špatný výsledek. Výkonnější hardware tuhle část práce nepřeskočí.
Nejdražší chyba? Když si model sám vystaví jedničku
Pokud stejný model vymyslí zadání, napíše řešení a prohlásí ho za správné, vytvořili jste velmi sebevědomou zkušební komisi. Ověření výsledku musí stát na pravidlech, která nejsou závislá na agentově závěrečné odpovědi.
U servisního případu kontrolujte konkrétní změny v databázi. Vznikl požadavek pro správné zařízení? Nevznikly dva? Zůstal otevřený, pokud příčina trvá? Nezměnila se zároveň jiná zakázka? Úspěšné volání rozhraní potvrzuje přijetí operace, nikoli splnění celého zadání.
ThinkingBox používá 507 úloh a každou opakuje dvacetkrát z čistého výchozího stavu. Přitom rozlišuje úspěch alespoň jednou za dvacet pokusů od skutečně pozorovaného výsledku dvacet z dvaceti. To jsou zásadně odlišná čísla. Ani druhé samozřejmě negarantuje bezchybný provoz navždy. Metodika Microsoftu.
Pro vlastní pilot navrhuji oddělit testovací případy ještě před generováním trénovacích variant. Příbuzné situace ponechte ve stejné skupině. Jinak se téměř totožný příklad dostane do tréninku i závěrečné zkoušky a výsledek bude zbytečně optimistický.
Zkontrolujte také samotný ověřovací program. Předložte mu úmyslně chybný stav: správný požadavek plus jeden navíc, nesprávné zařízení nebo neoprávněnou změnu. Jestli takový výsledek projde, opravujte kontrolu.
Zpravodajský kontext nabízí nečekanou paralelu. Nové forenzní posouzení egyptských ostatků přineslo další podporu hypotéze obětování služebnictva. Rozhodující byly fyzické stopy, nikoli přesvědčivost příběhu. U agentů hledejte obdobně konkrétní důkazy v datech. Zpráva o výzkumu.
LoRA může zlevnit dotrénování. Oprávnění ale nevyřeší
Jakmile máte ověřená data, přichází otázka dotrénování. Nejprve zkuste upravit zadání a popisy nástrojů. Pokud agent neví, který ze dvou podobných identifikátorů použít, možná stačí opravit rozhraní. Trénovat model kvůli nesrozumitelnému názvu parametru bývá drahý způsob, jak se vyhnout úklidu.
Pro opakující se chyby v postupu může dávat smysl LoRA. Tato metoda nechává původní váhy modelu zmrazené a učí menší přídavné matice. Snižuje počet trénovaných parametrů a paměťové nároky oproti plnému dotrénování. Implementaci nabízí knihovna PEFT na Hugging Face.
Rozpočet hardwaru odvozujte od délky celých průběhů úloh. Krátká odpověď a dvacet volání nástrojů jsou odlišné zátěže. Změřte malou trénovací dávku, zaznamenejte špičkovou spotřebu paměti a teprve potom objednávejte delší pronájem GPU. Do výběru patří také licence modelu a podmínky použití dat vytvořených učitelským modelem.
Samostatnou vrstvou zůstávají přístupová práva. Apple 2. října 2026 oznámil připravované dodatečné kontroly úplného přístupu k disku. Výslovně upozornil na rostoucí rizika autonomních agentů. Oznámení samo nepotvrzuje plošné nasazení změny. Vyjádření Applu.
Praktický důsledek je přímočarý: generátor dat potřebuje přístup ke zkušebním podkladům. Produkční hesla, zákaznická pošta a celý domácí adresář mu nepomohou vytvořit kvalitnější učební plán. Rozsah přístupu omezte technicky. Věta „na ostatní soubory nesahej“ v zadání není přístupové oprávnění.
Kolik to stojí: počítejte správně dokončené případy
Následující rozpočet je modelový výpočet, nikoli ceník ServiceNow nebo nabídka konkrétního dodavatele. Počítá s již dostupným počítačem a ukazuje, které položky je snadné přehlédnout.
| Položka pilotu | Zvolený předpoklad | Náklad | |---|---:|---:| | Příprava pravidel a kontrol | 20 hodin × 900 Kč | 18 000 Kč | | Pronajatý výpočet | 30 hodin × 40 Kč | 1 200 Kč | | Volání externího modelu | Rozpočtový limit | 1 500 Kč | | Elektřina místního počítače | 0,25 kW × 40 hodin × 6 Kč/kWh | 60 Kč | | Celkem | Bez nového hardwaru | 20 760 Kč |
Skutečné sazby doplňte podle nabídky a vlastní faktury. Hlavní položkou této kalkulace je lidská práce. Levnější elektřina projekt sama nezachrání.
Předpokládejme 600 případů měsíčně a čistou úsporu čtyř minut na případ, už po započtení kontroly. To je 40 hodin. Při interním nákladu 450 Kč za hodinu odpovídá získaná kapacita 18 000 Kč měsíčně. Odečtete-li 3 000 Kč na provoz a údržbu, modelová návratnost pilotu vychází přibližně na 1,4 měsíce.
Jenže pokud zbude úspora pouhé jedné minuty, získáte kapacitu za 4 500 Kč. Po stejných provozních nákladech zůstane 1 500 Kč a návratnost se natáhne téměř na čtrnáct měsíců.
Uvolněná kapacita navíc není automaticky úspora na bankovním účtu. Musíte ji využít. Sledujte proto dobu kontroly, opravy, opakované pokusy a cenu správného výsledku. Samotný počet vygenerovaných tokenů ekonomiku služby nevysvětlí.
Energetika nabízí dobrý pilot. Začněte reklamací, ne řízením baterie
Pro energetickou firmu bych vybral kontrolu podkladů k reklamaci měření. Má jasný vstup, dohledatelné záznamy a výsledek, který může před odesláním schválit pracovník. Agent může hledat mezery, porovnávat identifikátory a připravovat návrh zprávy.
Do testů zahrňte jednotky i čas. Záměna kW a kWh není kosmetika. Stejně tak záleží na délce intervalu. OTE uvádí zavedení patnáctiminutové obchodní periody na propojeném denním trhu pro dodávku od 1. října 2025. Data proto nelze bez kontroly zpracovávat jako univerzální hodinovou řadu. Dokumentace OTE.
Pro návrh vlastního scénáře lze začít u oblastí, které představují stránky SmartEnergyShare: IoT monitoring, sdílení elektřiny a služby pro firmy. Jde o inspiraci pro výběr procesu; jejich uvedení není tvrzením, že služba používá AutoSynthData.
Obchodní možnosti pak porovnejte na smartenergyshare.com. Pro další čtení k praktickým energetickým tématům můžete využít [ShareElectric.cz](https://share-electric.cz) a ke komunitní energetice [SdíleníElektřiny.com](https://sdilenielektriny.com).
První pilot omezte na jeden proces a předem určete měřítko úspěchu. Například kratší zpracování při nezhoršené správnosti a nulových neoprávněných zápisech v testovací sadě. Přidejte případy, které musí agent předat člověku.
Moje předpověď? Firmy časem přestanou kupovat agenty podle toho, jak dobře mluví. Budou chtít vidět účet za správně dokončenou práci. Začněte tedy jednou reklamací, změřte její skutečný průběh a první trénovací data postavte na chybách, které opravdu stojí peníze.
Zdroje
Následující podklady oddělují výzkumné výsledky, bezpečnostní oznámení a energetický kontext. Rozpočtová tabulka i návrh pilotu jsou vlastní ilustrativní výpočty a doporučení tohoto článku. Uvedené organizace neslibují popsanou návratnost a neověřovaly zde navržené firemní nasazení.
- ServiceNow CoreAI: AutoSynthData a tvorba trénovacích dat — Primární popis metody a výsledků. Při plánování vlastního experimentu slouží jako výchozí bod pro porovnání prostředí, cílových úloh a použitého způsobu vyhodnocení.
- Microsoft: agent hlásí dokončení, databáze nesouhlasí — Podklad pro údaje o spolehlivosti. Při čtení výsledků rozlišujte schopnost uspět alespoň jednou a opakovaně pozorovanou bezchybnost; pro rozhodování o nasazení mají jiný význam.
- Apple: připravované změny úplného přístupu k disku — Oficiální oznámení bezpečnostního záměru. Slouží jako zdroj k postoji výrobce systému, nikoli jako doklad, že konkrétní počítač už dostal nové ochranné mechanismy.
- OTE: přechod na patnáctiminutové obchodní intervaly — Český provozní podklad pro energetickou část. Při přípravě testovacích dat pomáhá určit časové rozlišení a dohledat dokumentaci souvisejících změn trhu.
- IEA: Energie a umělá inteligence — Mezinárodní kontext vztahu výpočetní infrastruktury a energetiky. Pro vlastní rozpočet ho doplňte měřením konkrétní sestavy; obecná analýza nenahrazuje spotřebu vašeho počítače ani cenu jeho provozu.
Obchodujete s batteriovými úložišti nebo hledáte partnera pro flexibilitu a day trading elektřiny? SmartEnergyShare nabízí kompletní řešení pro BESS projekty od 50 do 250 kW — obchodování flexibility, SVR služby a IoT monitoring. Zjistěte víc →
Další články na toto téma najdete na: Electric-Share.cz Žebříček AI agentů odhalil nepříjemnou pravdu: větší mode... Vice o training and