AutoSynthData od ServiceNow premieňa zlyhania agentov na tréningové zlato

AutoSynthData od ServiceNow premieňa zlyhania agentov na tréningové zlato

Stručná odpoveď: AutoSynthData od ServiceNow CoreAI premieňa zlyhania agentov a úspechy učiteľov na overené syntetické úlohy SFT, keď podniky potrebujú kompetencie v prostredí, nielen široké porovnávacie skóre. Odstraňuje medzery do kariet so špecifikáciami schopností, vynásobí overiteľnú prácu a potom pred doladením upraví kvalitu. Autorom hlásené výsledky EnterpriseOps Gym lifts sú platné, ak sa sila učiteľa, kvalita overovateľa a vernosť prostrediu zhodujú.

Kľúčové poznatky:

Karty schopností: Zredukujte zlyhania na karty, aby generátory nikdy nevideli pôvodné ID.

Auditabilita overovateľa: Uprednostňovať kontroly konečného stavu SQL, ktoré odmietajú mutované nesprávne výsledky.

Pásmo obtiažnosti: Trénujte iba úlohy, ktoré cieľová skupina rieši zriedka a učiteľ ich zvyčajne vyrieši.

Ľudské preskúmanie: Pred preškolením si overte dôležité zásady a nezvratné opatrenia ľudským konaním.

Pohybujúca sa hranica: Po SFT prehodnoťte a posuňte cieľovú fázu smerom k zostávajúcim medzerám.

Agenti AI v podnikoch zriedkakedy zlyhávajú kvôli nedostatku všeobecných znalostí. Zlyhávajú preto, lebo prostredie je špecifické: politiky tiketov, zvláštnosti schém, zmluvy o nástrojoch, databázy s nasadeným pôvodom, články znalostí a pracovné postupy naprieč systémami, ktoré nevyzerajú ako učebnicové ukážky. Model, ktorý dosahuje dobré výsledky v otvorených benchmarkoch, sa môže stále zastaviť, keď ďalší krok musí rešpektovať okno zmien, vzťah CMDB alebo overovač, ktorý kontroluje konečný stav, a nie plynulý chat.

ServiceNow CoreAI / ServiceNow-AI publikovali AutoSynthData , aby priamo riešili túto medzeru. Menovaný autor Esakkivel Esakkiraja opisuje postup, ktorý prevádza zlyhania cieľového agenta – spolu s úspechmi silnejšieho učiteľa – na validované syntetické tréningové úlohy prispôsobené podnikovým prostrediam. Cieľom nie je zhromažďovať viac protokolov chatu. Ide o znásobenie náročnej a overiteľnej práce, ktorá precvičuje rovnakú schopnosť za nových podmienok, takže kontrolované doladenie môže uzavrieť medzery špecifické pre dané prostredie.

Tento článok sa venuje základnej myšlienke, abstrakcii úloh, generovacej a kontrolnej slučke kvality, zdieľanej architektúre a autorom hláseným výsledkom o EnterpriseOps Gym v hybridnom a ITSM prostredí. Zachováva si to, čo výskum opisuje: pohyblivé kurikulum syntetických úloh, nie tvrdenie, že akýkoľvek podnik je zrazu vyriešený.

Prečo environmentálna kompetencia prevyšuje široké schopnosti

Podniky potrebujú agentov, ktorí fungujú v ich prostredí – v ich systémoch, pravidlách a stave údajov. Široké schopnosti nie sú to isté ako kompetencia prostredia. Agent môže vedieť, ako zvyčajne funguje správa IT služieb, a napriek tomu mu môže uniknúť lokálna politika, ktorá zakazuje určité prechody, alebo nástroj, ktorý aktualizuje súvisiacu tabuľku až po existencii potrebného záznamu.

Jednotlivé zlyhania sú informatívne, ale slabé ako tréningové dáta. Jedna prerušená trajektória ukazuje slabinu; neposkytuje desiatky blízkych situácií, ktoré by model naučili zotaviť sa za variácií. Tímy potrebujú veľa nových úloh, ktoré precvičujú tú istú schopnosť inak, zostávajú dokončiteľné v danom prostredí, pôsobia realisticky, keď ich používateľ požaduje, a zostávajú overiteľné oproti kontrolám výsledkov.

To je tlak na dizajn, ktorý stojí za AutoSynthData. Zlyhania sa stávajú signálmi pre karty schopností. Karty sa stávajú generátormi nových úloh. Silnejší učiteľ demonštruje úspešné trajektórie. Filtre a overovače rozhodujú o tom, čo vstupuje do dolaďovacej sady s dohľadom. Po tréningu hodnotenie posúva hranicu smerom k zostávajúcim medzerám. Slučka je skôr v tvare učebných osnov ako jednorazového výpisu údajov.

Pre odborníkov je dôležité rámcovať. Ak ukladáte iba neúspešné výzvy, riskujete preťaženie týmito presnými entitami a frázami. Ak generujete iba neobmedzené syntetické otázky, riskujete úlohy, ktoré sú nemožné, nerealistické alebo neoveriteľné. AutoSynthData sa nachádza medzi týmito extrémami: čistí to, čo zlyhalo, do špecifikácie schopnosti a potom regeneruje úlohy, ktoré zachovávajú pevné jadro a zároveň menia tvar povrchu a ovládateľné rozmery.

Tvar praktickej úlohy: systém, výzva, overovateľ

Funkčná abstrakcia pre agentickú prácu je: úloha sa rovná systémovej špecifikácii, používateľskej výzve a overovateľovi. Každá časť nesie obmedzenia, ktoré udržiavajú syntetické dáta uzemnené a dôveryhodné.

Špecifikácia systému zahŕňa obmedzenia, politiky a počiatočný stav – napríklad počiatočné hodnoty databázy a články znalostí. Musí zostať kompatibilná s dostupnými nástrojmi a stavom. Ľubovoľné obmedzenia obtiažnosti, ktoré ignorujú zmluvy nástrojov alebo realizmus počiatočných hodnôt, majú tendenciu vytvárať krehké úlohy, ktoré učia nesprávnu lekciu.

Kvalita používateľskej výzvy má tri aspekty. Realizovateľnosť sa pýta, či existuje platná trajektória. Realizmus sa pýta, či by o to používateľ vierohodne požiadal. Náročnosť sa pýta, či úloha odhaľuje aktuálnu slabinu agenta, a nie niečo, čo cieľ už spoľahlivo rieši. Výzva, ktorá je pre cieľ triviálna, mrhá rozpočtom na školenie; výzva, ktorá je nemožná, mrhá dôverou v hodnotenie.

Kvalita overovateľa závisí od konzistencie, spoľahlivosti a úplnosti. Príliš laxné a slabé trajektórie prechádzajú úspešne. Príliš obmedzujúce na jednu trajektóriu a platné alternatívne riešenia zlyhávajú. Podnikové prostredia často uprednostňujú kontroly výsledkov založené na SQL alebo stave, pretože hodnotia svet po tom, čo agent koná, nie presnú cestu tokenu, ktorou sa agent vydal.

AutoSynthData sa opiera o túto triádu, takže vygenerovaná práca zostáva pevne uzemnená. Generátory nevymýšľajú voľne dostupné kvízy. Vytvárajú úlohy, ktoré je možné vykonať v adaptéri prostredia a posudzovať overovačmi, ktoré sa zaujímajú o požadované vlastnosti konečného stavu.

Od diagnostického vyhodnotenia po karty so špecifikáciami schopností

Proces začína diagnostickým hodnotením cieľového agenta a silnejšieho učiteľa v danom prostredí. Súbežné analýzy odhaľujú, kde cieľ zlyháva a kde učiteľ uspeje. Tieto kontrastné prípady sú základným materiálom pre návrh učebných osnov.

Nasleduje destilácia do upravených kariet so špecifikáciami schopností. Karta zachytáva testovanú schopnosť, relevantné nástroje alebo tvar pracovného postupu, kde cieľ zlyhá a učiteľ uspeje, požadované vlastnosti konečného stavu a dimenzie, ktoré sa môžu meniť pri vytváraní nových úloh. Rozhodujúce je, že generátor nedostáva pôvodné výzvy, entity, trajektórie ani podrobnosti overovateľa – iba karty.

Táto sanitizácia je zámerný krok proti preťaženiu. Ak by generátor videl presné čísla zlyhávajúcich tiketov, ID článkov znalostí alebo záznamy učiteľov, bol by v pokušení parafrázovať tú istú epizódu. Karty vynucujú abstrakciu: učiť schopnosť v kontrolovateľnej variácii, nie zapamätanú inštanciu.

Keď karty existujú, systém z nich generuje nové úlohy. Učiteľ potom predvedie úspešné trajektórie pre riadené doladenie. Tieto ukážky nie sú voľnou formou rady; sú to úspechy založené na prostredí, ktoré prechádzajú rovnakým druhom overenia, o aké sa stará aj učebné osnovy.

Dvojfázová štruktúra škály. Cieľová fáza sa zameriava na overené vzorky okolo medzier – úlohy s najvyšším signálom v blízkosti miesta, kde slabý agent preruší činnosť. Fáza násobenia vytvára nové varianty akceptovaných cieľov. Znásobené vzorky nemôžu vytvárať ďalšie kolá násobenia, čo obmedzuje posun. Toto pravidlo je malé, ale dôležité: neohraničená rekurzívna variácia sa môže odchýliť od schopnosti, ktorú karta pomenovala.

Zdieľaný ovládač, adaptér prostredia a pohyblivá hranica

Z hľadiska architektúry AutoSynthData používa zdieľaný kontrolér a adaptér prostredia. Kontrolér riadi diagnostiku, kardovanie, generovanie, ukážky učiteľov, kontroly kvality a dávkovú kontrolu. Adaptér prepája tieto kroky s konkrétnym podnikovým prostredím – nástrojmi, stavom, politikami a overovačmi – takže tá istá riadiaca slučka sa môže zameriavať na rôzne domény bez toho, aby bolo potrebné prepisovať logiku učebných osnov od začiatku.

Po kontrolovanom doladení sa proces prehodnotí. Učebné osnovy sa potom posúvajú smerom k zostávajúcim medzerám: k pohyblivej hranici, a nie k statickému súboru údajov. Experimenty opísané v práci sa zameriavajú na kontrolované doladenie. Tá istá slučka by mohla neskôr podporiť posilňovacie učenie; tento smer sa zaznamenáva ako plánovaný, nie ako dokončený.

Pre podnikové tímy je architektonická lekcia modulárna. Kontroléry by nemali napevno kódovať schému jedného tiketu. Adaptéry by mali poskytnúť dostatočnú presnosť stavu a nástrojov, aby overovače mohli byť zmysluplné. Učebné osnovy by mali výsledky hodnotenia považovať za ďalší vstup, nie za jednorazovú hodnotiacu tabuľku.

EnterpriseOps Gym . Ide o rozsiahlu pracovnú stanicu pre podnikových agentov s približne 1 150 úlohami spravovanými expertmi v 8 doménach, zhruba 512 nástrojmi, približne 164 databázovými tabuľkami, kontajnerovým vykonávaním, overovaním výsledkov založeným na SQL, operáciami riadenými politikami, hybridnými scenármi medzi doménami, testovaním neuskutočniteľnosti a odmietnutia a dlhodobými stavovými trajektóriami. AutoSynthData nie je prezentovaný ako vynálezca tejto telocvične; telocvičňa je záťažovým testovacím lôžkom pre syntetickú slučku.

Kontrola kvality na úrovni vzorky, ktorá zachováva dôveryhodnosť syntetických úloh

Generovanie bez brán je spôsob, akým sa syntetické dáta agentov kazia. AutoSynthData opisuje kontrolu kvality na úrovni vzorky s niekoľkými doplnkovými kontrolami.

Filter obtiažnosti riešiteľa smeruje množinu k úlohám, ktoré sú pre cieľ ťažké a pre učiteľa riešiteľné. Opísaná konfigurácia uprednostňuje úlohy, ktoré cieľ vyrieši najviac v jednom z troch pokusov, zatiaľ čo učiteľ uspeje aspoň v dvoch z troch. V tomto pásme môžu kontrolované ukážky naučiť niečo, čo slabý model ešte nemá.

Pozitívne overenie vyžaduje, aby overovateľom prešla referenčná trajektória. Negatívne overenie vyžaduje, aby zlyhali mutované nesprávne výsledky. Spoločne testujú akceptačnú aj odmietaciu stranu kontroly. Ak sa kontrolujú iba pozitívne výsledky, permisívny overovateľ môže pripustiť odpad. Ak sa kontrolujú iba negatívne výsledky, príliš prísny overovateľ môže odmietnuť platnú prácu.

Slučka kritiky a opráv s limitom opakovania sa pokúša opraviť úlohy, ktoré zlyhajú v bránach, namiesto toho, aby okamžite zahodila každú takmer neúspešnú úlohu. Limity opakovania sú dôležité: nekonečné opravy môžu vymýšľať čoraz umelejšie obmedzenia len preto, aby sa splnil kontrolný zoznam.

Dávkové metahodnotenie potom prehľadáva celý súbor z hľadiska pokrytia, diverzity, redundancie a nespĺňajúcich cieľov. Vzorky udržiavajú jednotlivé položky spoľahlivé; dávkové hodnotenie zabraňuje zhlukovaniu učebných osnov na jednom úzkom spôsobe zlyhania alebo klonovaniu takmer duplikátov.

Tieto kontroly vysvetľujú, prečo môže proces stráviť hodiny produkciou tisícov vzoriek bez toho, aby sa objem považoval za náhradu za zhodu. Rýchlosť sa líši v závislosti od oblasti a veľkosti učiteľa, ale príbeh kontroly kvality je konzistentný: pásmo obtiažnosti, pozitívne a negatívne overenie, oprava s limitmi a potom meta-kontrola.

Nespracované zlyhania vs. karty vs. overené sady SFT

Pomáha porovnať, na čo je každý artefakt dobrý. Nespracované protokoly zlyhaní slúžia na diagnostiku. Karty schopností sú generatívne zmluvy. V praxi sa trénuje na validovaných kontrolovaných dolaďovacích súboroch.

Artefakt Čo obsahuje Sila Riziko pri izolovanom použití
Nespracované protokoly zlyhaní Výzvy, stavy, prerušené trajektórie, kontrasty s úspechom učiteľa Identifikuje skutočné medzery v živom prostredí Príliš málo vzoriek; ľahké preťaženie entít a fráz
Karty so špecifikáciami schopností Schopnosti, nástroje alebo pracovný postup, kontrast medzi úspechom a neúspechom, potreby konečného stavu, variabilné dimenzie Sanitizovaná abstrakcia pre generátory bez úniku originálov Karty bez kontroly kvality môžu stále viesť k nemožným alebo triviálnym úlohám
Overená sada SFT AutoSynthData Nové úlohy a ukážky pre učiteľov, ktoré prešli kontrolou obtiažnosti, overením a kontrolou Škálovanie s realistickými, uskutočniteľnými a kontrolovanými výsledkami Stále závisí od sily učiteľa, kvality overovateľa a vernosti prostrediu

V snímkach Hybrid a ITSM v EnterpriseOps Gym sa v autorom hlásených spusteniach ako cieľ použil Gemma-4-26B-A4B-it. Hybrid spároval tento cieľ s Qwen3.8-27B ako učiteľom a vyprodukoval približne 2 000 hybridných vzoriek za približne 18 hodíns najlepším kontrolným bodom v epoche 5. Priemerná hodnota Pass@1 sa zvýšila o 7,2 percentuálneho bodu – približne o 35 percent relatívne – pričom úspešnosť overovateľa sa posunula zo 63,01 percenta na 68,55 percenta, čím sa rozdiel v Pass@1 oproti referenčnému modelu znížil o približne 59 percent.

ITSM spároval rovnaký cieľ s DeepSeek-V4.1-Flash ako učiteľom a vyprodukoval približne 1 994 vzoriek za zhruba 66 hodín, čo je čiastočne dlhší čas kvôli väčšiemu učiteľovi a preto, že niektoré optimalizácie kanála ešte neboli zavedené. Priemerná úspešnosť pri priechode 1 sa posunula z 18,77 percenta na 27,18 percenta.

Doména Cieľ Učiteľ Vzorky a behové prostredie Výsledok hlásený autorom
Hybridný Gemma-4-26B-A4B-it Qwen3.8-27B ~2 000 vzoriek za ~18 hodín; najlepšia kontrolná epocha 5 Priemerná úspešnosť pri skúške 1 +7,2 pp (~35 % relatívne); úspešnosť overovateľa 63,01 % až 68,55 %; ~59 % rozdielu v úspešnosti pri skúške 1 oproti referenčnému bodu uzavretý
ITSM Gemma-4-26B-A4B-it DeepSeek-V4.1-Flash ~1 994 vzoriek za ~66 hodín Priemerná úspešnosť pri 1 18,77 % až 27,18 %

Tieto čísla čítajte ako výsledky výskumu spoločnosti o tejto telocvični v testovaných oblastiach – nie ako nezávislú replikáciu tretej strany a nie ako univerzálnu záruku pre podniky. Zisky sa prejavujú tam, kde sa zhodujú sila učiteľa, kvalita overovateľa a vernosť prostrediu.

Čo by mali odborníci kopírovať zo slučky

Aj keď váš stack nie je výskumným kanálom ServiceNow, vzor sa prenesie. Začnite párovým hodnotením cieľa podobného produkcii a silnejšieho učiteľa v spoľahlivom sandboxe. Preveďte zlyhania kontrastu na karty schopností, ktoré odstraňujú identifikátory a trajektórie. Generujte úlohy, ktoré menia povolené dimenzie a zároveň zachovávajú požadované vlastnosti konečného stavu. Nechajte učiteľa predviesť úspechy. Hradlo s pásmami obtiažnosti, pozitívnym a negatívnym overením, obmedzenou opravou a kontrolou diverzity dávok. Dolaďte, prehodnoťte a posuňte hranicu.

Venujte zvláštnu pozornosť návrhu overovača. Kontroly výsledkov SQL v štýle telocvične EnterpriseOps a operácie riadené politikami ilustrujú, prečo sú rubriky chatu samy o sebe slabé pre stavovú prácu. Ak váš overovač nedokáže rozlíšiť mutované nesprávne výsledky od správnych finálnych výsledkov, syntetická škála zosilní šum.

Rešpektujte aj ducha pravidla násobenia: varianty akceptovaných cieľov by nemali donekonečna vytvárať ďalšie varianty bez toho, aby sa vrátili k overeným jadrám. Drift je tichý. Učebné osnovy, ktoré pomaly vymýšľajú exotickejšie obmedzenia, môžu stále prechádzať povrchnými filtrami, pričom pôvodná schopnosť zostane nedostatočne natrénovaná.

Napokon, hybridnú prácu medzi doménami treba brať ako prvotriedny záťažový prípad. Bežní používatelia nezostávajú v jednom izolovanom prostredí. Hybridné úlohy, dlhodobé trajektórie a testovanie odmietnutia alebo neuskutočniteľnosti sú miesta, kde sa kompetencia prostredia prejaví – alebo hlasno zlyhá.

Výhrady, limity a pozorné čítanie ziskov

Výsledky hlásené autorom v EnterpriseOps Gym sú informatívne signály, nie všeobecná záruka. Zverejnené zisky hybridných technológií a ITSM sa vzťahujú na tieto domény a párovania modelov v rámci opísaného nastavenia. Iné domény, slabší učitelia, hlučnejší overovatelia alebo povrchnejšia vernosť prostredia môžu tento prínos znížiť alebo úplne vymazať.

Kvalita závisí od troch pilierov, ktoré žiadny marketingový lesk nemôže preskočiť. Sila učiteľa stanovuje strop pre demonštrácie. Kvalita overovateľa určuje dôveryhodnosť označení a filtrov. Vernosť prostrediu určuje, či naučené správanie prežije kontakt s produkčnými systémami, pravidlami a stavom údajov.

Experimenty spoločnosti AutoSynthData kladú dôraz na kontrolované jemné doladenie. Posilňovacie učenie je v publikovanej práci uvedené ako možné neskoršie použitie tej istej slučky, ktoré je skôr plánované ako dodané. Čitatelia by si nemali zamieňať dátový engine pripravený na učebné osnovy s hotovým tvrdením o trénovaní v reálnom čase.

Čitatelia by si tiež nemali zamieňať syntetický pipeline so samotnou lavicou. EnterpriseOps Gym poskytuje kurátorsky vybrané úlohy, nástroje, tabuľky, kontajnerizáciu a overovaciu štruktúru. AutoSynthData využíva tento druh prostredia na premenu zlyhaní na tréningové zlato. Obom častiam treba pripísať zásluhy: gymnázium stresuje agentov; pipeline znásobuje naučiteľné úlohy z diagnostikovaných medzier.

V rámci sandboxu sa tiež neponúka žiadny bezplatný obed, pokiaľ ide o výpočtový a kalendárny čas. Hybridná syntéza sa pre približne dvetisíc vzoriek dokončila rádovo v priebehu hodín; ITSM trval dlhšie s väčším zaťažením učiteľa a skorším tvarom pipeline. Tímy by mali po každom kroku učebných osnov vyčleniť prostriedky na inferenciu učiteľa, opakované pokusy pri kritike alebo oprave a prehodnotenie.

Kurikulárne myslenie pre tímy podnikových agentov

Najhlbšia myšlienka v AutoSynthData je skôr kurikulárna než čisto generatívna. Zlyhania diagnostikujú. Karty abstrahujú. Generovanie násobí. Kontrola kvality overuje. SFT aktualizuje cieľ. Opätovné vyhodnotenie posúva hranice. Táto sekvencia zaobchádza so zlepšovaním agenta ako so sériou lekcií založených na prostredí, a nie ako s jedným offline výpisom stôp.

Kurikulárne myslenie mení spôsob, akým vedúci rozdeľujú úsilie. Namiesto toho, aby ste žiadali len o viac lístkov alebo viac ľudských anotácií, pýtajte sa, ktoré schopnosti stále zlyhávajú pri variáciách, či majú tieto schopnosti čisté vlastnosti konečného stavu a či ich dokáže spoľahlivo predviesť silnejší učiteľ. Ak učiteľ nedokáže dostatočne často uspieť, syntetická SFT naučí nespoľahlivé správanie. Ak sú vlastnosti konečného stavu nejasné, overovatelia sa budú hádať s platnými stratégiami.

Mení to aj spôsob, akým hovoríte o úspechu. Preklenutie časti rozdielu medzi Pass@1 a referenčným modelom na Hybrid alebo posunutie ITSM Pass@1 z úrovne okolo dvadsiatky na úroveň okolo dvadsiatky v počte sérií hlásených autormi predstavuje pokrok v meranej kompetencii prostredia. Nie je to dôkaz, že každý pracovný postup, každá politika alebo každý prípad odmietnutia je vyriešený. Zachovajte si jazyk pohybujúcej sa hranice: zostávajúce rozdiely sa stanú ďalšou fázou Target, nie dodatočným posunom.

Pri návrhu programu spojte tento cyklus s ľudskou kontrolou tam, kde je v stávke veľa – bezpečnostné politiky, nezvratné akcie, regulované údaje – a zároveň nechajte automatizované brány prenášať objem na základe dobre špecifikovaných kontrol stavu. Syntetické údaje fungujú najlepšie, keď prostredie dokáže povedať áno alebo nie s jasnosťou podobnou SQL. Ťažko sa im darí, keď je úspech subjektívnym vkusom.

Poznámky k dizajnu týkajúce sa obtiažnosti, realizmu a odmietnutia

Zameranie sa na náročnosť si zaslúži druhý pohľad. Uprednostňovanie úloh, ktoré cieľ vyrieši maximálne v jednej tretine času, drží tréning ďalej od kvízov. Požiadavka na učiteľa, aby uspel aspoň v dvoch tretinách času, drží ukážky ďalej od hodov mincou. Toto pásmo je praktickým kompromisom medzi náročnosťou a učenlivosťou.

Realizmus zostáva miernejším kritériom, ale stále nevyhnutný. Podnikoví používatelia požadujú veci, ktoré zodpovedajú ich rolám a systémom. Generátory riadené iba tvrdosťou dokážu vymyslieť prepracované hádanky s viacerými obmedzeniami, ktoré by si žiadny operátor nevyžiadal. Karty schopností, ktoré uvádzajú variabilné dimenzie, pomáhajú, ale ľudia alebo meta-recenzia stále musia zachytiť surrealistické výzvy.

Testovanie odmietnutia a neuskutočniteľnosti, ktoré je súčasťou širšieho dizajnu EnterpriseOps Gym, pripomína tímom, že kompetencia zahŕňa aj povedať nie. Kanál optimalizovaný iba pre dokončiteľné úlohy môže nedostatočne natrénovať odmietnutie. Pri rozširovaní slučiek v štýle AutoSynthData zahrňte karty, kde správna konečná vlastnosť predstavuje bezpečné odmietnutie podľa politiky, nielen úspešnú mutáciu stavu databázy.

Dlhodobé stavové trajektórie prinášajú ďalší prvok v dizajne. Učiteľské demá musia zostať koherentné naprieč mnohými volaniami nástrojov. Verifikátory, ktoré kontrolujú iba posledný riadok tabuľky, môžu prehliadnuť prechodné prerušenia politík. Úplnosť v dizajne verifikátora znamená pokrytie vlastností, ktoré skutočne definujú úspech danej funkcie – vrátane obmedzení, ktoré musia zostať pravdivé počas celého procesu, nielen na konci.

Záverečné zhrnutie

AutoSynthData od ServiceNow CoreAI / ServiceNow-AI, ktorého autorom je Esakkivel Esakkiraja vo verejnom článku, je kanál, ktorý premieňa zlyhania cieľových agentov a úspechy učiteľov na overené syntetické tréningové úlohy pre podnikové prostredia. Abstrahuje zlyhania do upravených kariet so špecifikáciami schopností, generuje nové úlohy bez úniku pôvodných výziev alebo trajektórií, zhromažďuje ukážky učiteľov a vynucuje kontrolu kvality na úrovni vzoriek a dávok pred kontrolovaným jemným doladením.

Praktický mentálny model je úloha ako systémová špecifikácia, používateľská výzva a overovateľ – s uskutočniteľnosťou, realizmom a obtiažnosťou držanými v napätí a s overovateľmi, ktoré nie sú ani príliš laxné, ani viazané na jednu cestu. Fázy „zamerať sa a potom násobiť“, pravidlo „žiadne ďalšie seedovanie“ pre násobené vzorky, zdieľaný ovládač plus adaptér prostredia a prehodnotenie po SFT vytvárajú pohyblivú hranicu cez zostávajúce medzery.

V aplikácii EnterpriseOps Gym ukazujú autorom hlásené hybridné výsledky s Gemma-4-26B-A4B-it a Qwen3.8-27B zhruba dvetisíc vzoriek za približne osemnásť hodín a zmysluplné nárasty úspešnosti Pass@1 a overovateľa, čím sa zmenšuje veľká časť rozdielu oproti referenčnému modelu. ITSM s DeepSeek-V4.1-Flash ako učiteľom ukazuje nárast úspešnosti Pass@1 z 18,77 percenta na 27,18 percenta na približne 1 994 vzorkách počas dlhšieho obdobia. Tieto čísla považujte za skúmané signály v špecifických doménach, závislé od učiteľa, overovateľa a vernosti prostredia – a posilňovacie učenie ponechajte ako plánované rozšírenie slučky, nie ako hotové tvrdenie.

Ak si spomeniete na jednu vetu: podnikoví agenti sa zlepšujú, keď sa zlyhania stanú abstrahovanými, znásobenými, overenými ponaučeniami v rámci systémov, s ktorými musia denne pracovať – nie keď tímy iba opakujú ten istý pokazený lístok.

Praktický príklad: Rozšírenie zložitých prípadov ITSM zo zmrazenej sady zlyhaní v štýle telocvične

Scenár

Tím pre podnikové platformy v Spojenom kráľovstve – predstavte si stredne veľkú skupinu pre finančné služby, ktorá prevádzkuje ITSM v štýle ServiceNow s oknami zmien, vzťahmi CMDB a prechodmi riadenými politikami – má agenta podobného produkčnému, ktorý neustále naráža na tú istú triedu práce: aktualizácie medzi tabuľkami, ktoré musia rešpektovať predpoklad schválenia, vyhľadávania článkov znalostí, ktoré sú v konflikte s lokálnymi zmrazeniami zmien, a hybridné požiadavky, ktoré prechádzajú cez ITSM do susedných operačných nástrojov.

Zmrazia súkromný balík v štýle EnterpriseOps Gym (kontajnerový sandbox, kontroly výsledkov SQL, tabuľky s nasadenými číslami, pravidlá politík), takže skóre sú porovnateľné týždeň čo týždeň. Diagnostické spustenia ukazujú, že cieľový agent zlyháva tam, kde silnejší učiteľ uspeje. Vedenie chce viac tréningových signálov bez opakovaného prehrávania rovnakých čísel tiketov a ID entít. AutoSynthData (alebo ekvivalentná slučka syntetizátora zo zlyhaní, ak je výskumný kanál uzavretý v ich zásobníku) je kandidátom: premeniť zlyhania kontrastu na vyčistené karty so špecifikáciami schopností, generovať nové úlohy, zhromažďovať ukážky učiteľov a potom – čo je kriticky dôležité – pred akýmkoľvek preškolením skontrolovať syntetické stopy človekom.

Na Gym Pass@1 sa nič samo od seba nedodáva. Syntetické dáta sa považujú za kandidátske učebné osnovy, nie za bezplatnú pravdu.

Čo asistent potrebuje

  • Prístup k zmrazenému adaptéru prostredia v štýle telocvične: nástroje, stav seed-u, politiky a overovače SQL (alebo ekvivalentné overovače založené na stave).
  • Párové hodnotiace záznamy: zlyhania cieľov v porovnaní s úspechmi učiteľov pri rovnakých úlohách.
  • Schéma karty, ktorá zachytáva schopnosti, tvar nástrojov/pracovného postupu, kontrast medzi úspechom a zlyhaním, požadované vlastnosti konečného stavu a povolené dimenzie variácií – bez pôvodných výziev, entít, trajektórií alebo vnútorných prvkov overovača.
  • Pravidlá čistenia osobných údajov a politík (ID tiketov, používateľské mená, názvy CI, regulované polia) predtým, ako čokoľvek opustí sandbox alebo vstúpi do výzvy generátora.
  • Rad ľudských kontrol pre vzorkované syntetické úlohy a stopy učiteľov (uskutočniteľnosť, realizmus, spoľahlivosť overovateľa, prípady odmietnutia/neuskutočniteľnosti).
  • Jasné podmienky zastavenia: Fázy Cieľ a potom Násobenie; vynásobené vzorky nezavádzajú ďalšie kolá násobenia.

Príklad inštrukcie

Vedúci platformy k operátorovi učebných osnov (alebo k asistentovi orchestrácie, ktorý iba navrhuje karty a kontroluje balíčky - nepreškoľuje ani nepropaguje modely):

„Spustite diagnostický Pass@1 na zmrazených ITSM a hybridných segmentoch oproti nášmu aktuálnemu cieľu a určenému učiteľovi. Pre každé porovnanie, kde cieľ zlyhá a učiteľ uspeje aspoň v dvoch z troch pokusov, vytvorte upravenú kartu so špecifikáciou schopnosti: pomenujte schopnosť, uveďte relevantné nástroje, uveďte požadované vlastnosti konečného stavu a uveďte ovládateľné dimenzie (pásmo priority, súvisiaca trieda CI, príznak okna zmeny, typ konfliktu znalostí). Odstráňte čísla lístkov, identifikátory používateľov, názvy CI a surové trajektórie. Vygenerujte dávku nových úloh v cieľovej fáze iba z týchto kariet. Nechajte učiteľa preukázať úspechy. Použite pásmo obtiažnosti (cieľ ≤1/3, učiteľ ≥2/3), pozitívne a negatívne overenie a obmedzenú kritiku/opravu. Vytvorte kontrolný balíček s 5 % stratifikovanými vzorkami plus každú kartu odmietnutia/neuskutočniteľnosti. Nezačínajte SFT, kým dvaja recenzenti nepodpíšu balíček a kontroly čistenia PII neprejdú úspešne. Po SFT na kandidátskom kontrolnom bode znova vyhodnoťte zmrazený balík a na zastavenom súbore s presnou zhodou, ktorý sme nikdy nepoužili na generovanie. Nahláste pokrytie podľa triedy zlyhania a miery regresie oproti predchádzajúcemu produkčnému kontrolnému bodu.“ nepostupuje len na základe skóre v telocvični.“

Ako to otestovať

  1. Základné uzamknutie: Zaznamenajte mieru úspešnosti Pass@1 a overovateľa na zmrazenej sade podľa triedy zlyhania (poradie predpokladov, odmietnutie v okne zmien, hybridný medzinástrojový systém, konflikt znalostí). Sada a seeds sa počas cyklu udržujte nemenné.
  2. Audit kariet: Namátková kontrola, či generátory nikdy nedostávajú originálne výzvy, entity alebo stopy učiteľov – iba karty.
  3. Ukážka kontroly kvality: Potvrdenie, že pozitívne trajektórie prejdú overovačmi a mutované nesprávne výsledky zlyhávajú. Zamietnutie úloh, ktoré sú pre cieľ triviálne, alebo hodenie mincou pre učiteľa.
  4. Ľudské hodnotenie: Recenzenti označia každú vzorku ako ponechať / opraviť / vynechať z hľadiska uskutočniteľnosti, realizmu a bezpečnosti pravidiel. Sledujú zhodu medzi recenzentmi na zdieľanej podmnožine.
  5. Presná zhoda v zapamätávaní: Po vykonaní SFT kandidáta sa vyhodnotí zapamätávací súbor reálnych (alebo predtým zmrazených) úloh, ktoré nikdy neboli vstupmi do mykania alebo generovania. Samostatne sa vyhodnotia takmer parafrázy trénovacích úloh na odhalenie povrchného zapamätávania.
  6. Regresná brána: Akákoľvek trieda zlyhania, ktorá sa zhorší oproti predchádzajúcemu kontrolnému bodu produkcie, blokuje povýšenie, kým sa to nevysvetlí alebo neopraví.

Výsledok

Nevymýšľajte si tu percentá odchýlok. Použite plán merania a pri citovaní publikovaných výskumných údajov ich označte ako TVRDENIE Z ČLÁNKU.

Plán merania (čo by mal tento tím nahlásiť):

  • Pokrytie tried zlyhania: podiel diagnostikovaných tried medzier, ktoré vyprodukovali ≥N akceptovaných úloh cieľovej fázy po kontrole kvality (definujte N vopred, napr. 20 akceptovaných úloh na triedu).
  • Presná zhoda v holdout: Úspešnosť Pass@1 / overovateľa na nedotknutom holdout pred vs. po kandidátskej SFT (rovnaké semená, rovnaký overovateľ).
  • Miera regresie: počet tried zlyhania, kde Pass@1 prekročí predchádzajúci kontrolný bod produkcie; blok, ak dôjde k regresii ktorejkoľvek bezpečnostne kritickej triedy.
  • Výťažnosť z kontroly: ponechajte / opravte / mieru pádu na balíčku pre ľudské hodnotenie; ak miera pádu prudko stúpne, pozastavte násobenie a opravte karty alebo overovače.
  • Zlyhania čistenia: počet vzoriek, ktoré neprešli kontrolami PII/politík pred schválením kontroly (cieľ: nula únikov do sady SFT).

ČLÁNOK NÁROK (autor nahlásil v EnterpriseOps Gym - nie je to nameraný výsledok tohto tímu): Hybridné behy s Gemma-4-26B-A4B-it ako cieľom a Qwen3.8-27B ako učiteľom vyprodukovali približne 2 000 vzoriek za zhruba 18 hodín, pričom priemerná Pass@1 sa zvýšila o približne 7,2 percentuálneho bodu a úspešnosť overovania sa posunula zo 63,01 % na 68,55 %. ITSM s DeepSeek-V4.1-Flash ako učiteľom posunul priemernú Pass@1 z 18,77 % na 27,18 % na približne 1 994 vzorkách počas dlhšieho obdobia (~66 hodín). Považujte ich za skúmané signály na špecifických doménach a párovaniach, nie za univerzálnu záruku pre produkčný stack v Spojenom kráľovstve.

Ilustratívny tvar programu (predpoklady, nie merané zisky): Ak tím prijme ~2 000 vzoriek kontrolovaných kontrolou kvality pre jeden cyklus ITSM, započíta inferenciu učiteľa a kontrolu na úrovni 5 % stratifikovaného vzorkovania a povýši sa len vtedy, keď zdržanie sa nevedie k regresii bezpečnostne kritických tried, „výsledkom“, ktorý si môžu s vážnou tvárou nárokovať, je zrelosť procesu – auditované učebné osnovy, vyčistené záznamy a porovnateľné delty zmrazených súprav – nie sľúbený percentuálny nárast.

Čo sa môže pokaziť

  • Zaobchádzanie so syntetizátorom ako s voľnou pravdou: Preskočenie ľudského preskúmania alebo negatívneho overenia umožňuje permisívnym overovateľom pripustiť odpad vo veľkom rozsahu.
  • Únik entít: Vkladanie originálnych ID lístkov alebo stôp učiteľov do generátora vedie k preusporiadaniu parafráz; existujú karty, ktoré tomu zabraňujú.
  • Neobmedzené násobenie: Umožnenie vynásobenia vzoriek zavádzať ďalšie kolá sa odchyľuje od pomenovanej schopnosti.
  • Doprava v rámci Gym-score: Povýšenie, pretože frozen-suite Pass@1 vzrástol, zatiaľ čo návštevnosť v rámci holdout alebo production shadow sa zhoršila.
  • Slabý strop učiteľa: Ak učiteľ nedokáže prejsť pásmo úspešnosti ≥2/3, SFT učí nespoľahlivé ukážky.
  • Neurčité overovače: Rubriky v chate namiesto kontrol na základe štátu hodnotia plynulé nesprávne záverečné testy ako úspech.
  • Odmietnutie nedostatočného zaškolenia: Optimalizácia iba pre dokončiteľné mutácie spôsobuje, že okno zmien a poklesy politík sú krehké.
  • Únik PII: Syntetické výzvy, ktoré po plytkom čistení znova zavedú skutočné CI alebo používateľské mená.

Praktické ponaučenie

Použite slučky v štýle AutoSynthData – alebo ekvivalentný vzorec syntézy z chýb, ak kanál ServiceNow CoreAI nie je vo vašej nájomnej sieti k dispozícii – na vynásobenie zložitých, overiteľných prípadov ITSM z diagnostikovaných medzier. Dezinfikujte ich do kariet schopností, overte ich s obtiažnosťou a pozitívnym/negatívnym overením, vyčistite PII a vzorky skontrolované človekom pred SFT. Merajte pokrytie triedou zlyhania, presnú zhodu pozícií a mieru regresie. Citujte ČLÁNOK NÁVRH Údaje o telocvični iba ako externý výskumný kontext. Syntetické údaje sú palivom pre učebné osnovy, nie zárukou: auditujte vzorky, uchovávajte sadu zmrazenú pre spravodlivé porovnanie a nikdy neposielajte na základe samotného skóre telocvične.

Často kladené otázky

Čo je AutoSynthData a na aký problém sa zameriava?

AutoSynthData je kanál ServiceNow CoreAI / ServiceNow-AI, ktorý opísal Esakkivel Esakkiraja a ktorý spája zlyhania cieľového agenta s úspechmi silnejšieho učiteľa do validovaných syntetických tréningových úloh pre podnikové prostredie. Zameriava sa na kompetencie v danom prostredí – lokálne politiky, schémy, nástroje a stav – a nie na široké všeobecné znalosti. Cieľom je znásobiť tvrdú a kontrolovateľnú prácu, aby kontrolované doladenie mohlo opraviť medzery špecifické pre dané prostredie namiesto opakovania tej istej chybnej úlohy.

Prečo sa environmentálna kompetencia líši od širokej modelovej spôsobilosti?

Podnikoví agenti často zaváhajú, pretože samotné prostredie je špecifické: politiky tiketov, zvláštnosti schém, zmluvy o nástrojoch, nasadené databázy a pracovné postupy medzi systémami. Model, ktorý vyzerá dobre v otvorených benchmarkoch, sa môže stále zamrznúť v okne zmien, vzťahu CMDB alebo overovači, ktorý kontroluje konečný stav. Široké možnosti nie sú to isté ako znalosť toho, ako sa vaše systémy, pravidlá a stav údajov správajú pri prechodoch riadených politikami.

Aký je praktický tvar úlohy, ktorý používa AutoSynthData?

Funkčný tvar je úloha rovná sa systémovej špecifikácii, používateľskej výzve a overovateľovi. Systémová špecifikácia obsahuje obmedzenia, politiky a počiatočný stav, ako sú napríklad databázové semená a články znalostí. Používateľské výzvy sa hodnotia z hľadiska uskutočniteľnosti, realizmu a náročnosti. Verifikátory sa ideálne opierajú o kontroly výsledkov založené na SQL alebo stave, takže hodnotia svet po tom, čo agent koná, nielen presnú cestu tokenu, ktorú prešiel.

Ako sanitizované karty so špecifikáciami schopností zabraňujú preplneniu?

Diagnostické behy porovnávajú, kde cieľ zlyhá a učiteľ uspeje, a potom tieto prípady zredukujú na upravené karty so špecifikáciami schopností. Karta zaznamenáva tvar schopností, nástrojov alebo pracovného postupu, kontrast zlyhania/úspechu, požadované vlastnosti konečného stavu a dimenzie, ktoré sa môžu meniť. Generátor nikdy nevidí pôvodné výzvy, entity, trajektórie ani podrobnosti overovateľa – iba karty – takže nové úlohy tlačia na jadro bez parafrázovania zapamätanej epizódy.

Aké sú fázy Cieľ a Násobenie v procese?

Cieľová fáza sa sústreďuje na overené vzorky okolo medzier – úlohy s najvyšším signálom v blízkosti miesta, kde slabý agent prestane fungovať. Fáza násobenia vytvára nové varianty akceptovaných cieľov. Znásobené vzorky nemôžu vytvárať ďalšie kolá násobenia, čo drží odklon od pomenovanej schopnosti pod kontrolou. Po kontrolovanom doladení prehodnotenie posúva učebné osnovy smerom k zostávajúcim medzerám, a nie k statickému odkladu.

Ako kontrola kvality na úrovni vzorky zachováva dôveryhodnosť syntetických úloh?

Filter obtiažnosti riešiteľa uprednostňuje úlohy, ktoré cieľ vyrieši v maximálne jednom z troch pokusov, zatiaľ čo učiteľ uspeje aspoň v dvoch z troch. Pozitívne overenie potrebuje referenčnú trajektóriu na úspešné splnenie; negatívne overenie potrebuje mutované nesprávne výsledky na zlyhanie. Slučka kritiky a opravy s limitom opakovaných pokusov sa snaží napraviť takmer neúspešné úlohy a dávkové metahodnotenie kontroluje pokrytie, diverzitu, redundanciu a neúspešné ciele v celej množine.

Akú architektúru používa AutoSynthData v podnikových doménach?

Spáruje zdieľaný ovládač s adaptérom prostredia. Ovládač spúšťa diagnostiku, kardovanie, generovanie, ukážky učiteľov, kontroly kvality a dávkovú kontrolu. Adaptér prepája tieto kroky do konkrétneho prostredia sandbox – nástroje, stav, politiky a overovače – takže tá istá riadiaca slučka môže smerovať na rôzne domény bez prepisovania logiky učebných osnov od začiatku.

Čo je EnterpriseOps Gym v tomto výskumnom kontexte?

EnterpriseOps Gym je rozsiahla platforma pre podnikových agentov, ktorá sa používa ako záťažové testovacie platformy s približne 1 150 úlohami spravovanými expertmi v 8 doménach, zhruba 512 nástrojmi, približne 164 databázovými tabuľkami, kontajnerovým vykonávaním, overovaním výsledkov založeným na SQL, operáciami riadenými politikami, hybridnými scenármi a dlhodobými stavovými trajektóriami. AutoSynthData nie je prezentovaná ako vynálezca tejto posilňovne; posilňovňa ukazuje syntetickú slučku v akcii.

Aké výsledky nahlásené autorom sa zobrazujú pre hybridné nastavenia a nastavenia ITSM?

V aplikácii EnterpriseOps Gym hybridné testy s cieľom Gemma-4-26B-A4B-it a učiteľom Qwen3.8-27B vyprodukovali približne 2 000 vzoriek za zhruba 18 hodín, pričom priemerná úspešnosť pri testovaní sa zvýšila o približne 7,2 percentuálneho bodu a úspešnosť overovania sa posunula zo 63,01 % na 68,55 %. ITSM s učiteľom DeepSeek-V4.1-Flash posunul priemernú úspešnosť pri testovaní sa z 18,77 % na 27,18 % na približne 1 994 vzorkách počas dlhšieho obdobia. Tieto signály považujte za preskúmané signály na špecifických párovaniach, nie za univerzálnu záruku produkcie.

Akým chybám by sa mali tímy vyhnúť pri používaní slučiek synth-from-failures?

Nezaobchádzajte so syntetickými údajmi ako s voľnou pravdou a nevynechávajte ľudské preskúmanie a negatívne overenie. Vyhnite sa vkladaniu originálnych ID lístkov alebo stôp učiteľov do generátora, nechávaniu násobených vzoriek nasadzovať ďalšie kolá alebo propagácii na Gym Pass@1 samostatne, zatiaľ čo sa zhoršuje návštevnosť v rámci blokovania alebo tieňovej komunikácie. Sledujte tiež slabých učiteľov pod pásmom úspešnosti, nejasné rubriky chatu namiesto kontrol stavu, prípady odmietnutia nedostatočného tréningu a únik osobných údajov po povrchnom prehľade.

Referencie

  1. Objímajúca tvár — AutoSynthData — huggingface.co
  2. Telocvičňa EnterpriseOps — enterpriseops-gym.github.io
  3. arXiv — arxiv.org
  4. GitHub — EnterpriseOps-Telocvičňa — github.com
Kvíz
1. Na aký problém sa primárne zameriava AutoSynthData od ServiceNow CoreAI?

2. Prečo AutoSynthData zhromažďuje zlyhania do upravených kariet so špecifikáciami schopností?

3. Aké pásmo obtiažnosti preferuje opísaný filter riešiteľa pre trénovacie úlohy?

4. Ako je štruktúrovaná riadiaca slučka AutoSynthData v rôznych prostrediach?

5. Aká zmena Pass@1 nahlásená autorom sa uvádza v aplikácii EnterpriseOps Gym Hybrid pre cieľ Gemma-4-26B-A4B-it?


Späť na blog