Բլոգ

Թարմացվել է 17 րոպե կարդալուԳործակալների ստեղծում և գործարկումՈւսուցում

Մարտական AI գործակալների ձախողման ռեժիմներ (և ինչպես նախագծել դրանց դեմ)

Մարտական AI գործակալների ձախողման ռեժիմներ, որոնց իրականում հանդիպում են օպերատորները. սխալ tool գրառումներ, հնացած համատեքստ, բացակա վերահսկման կետեր, լուռ որակի անկում. նախագծման վերահսկումներ և հայտնաբերում - առաջնային աղբյուրներով.

Northstar

Northstar-ն AI agent systems ստուդիա է։ Ալեքսը՝ engineering/product, Ջորդանը՝ operations/workflow fit։ Production գործակալներ առկա tools-ում։

Alex Morgan · LinkedIn · Northstar

Վերահսկվող մարտական գործակալի ուղի՝ կանգառի կոճակով և մարդու վերանայման ցիկլով

Մարտական AI գործակալները հազվադեպ են ձախողվում, որովհետև մոդելը «բավական խելացի չէ». Դրանք ձախողվում են, որովհետև մոդելի շուրջ համակարգը - միացումներ, համատեքստ, իրավունքներ, դարպասներ և սեփականություն - անավարտ է. Նախագծեք դեմ. սխալ tool գրառումներ, հնացած կամ չստուգված համատեքստ, բացակա հաստատման դարպասներ, prompt-ի դրեյֆ առանց evals, և մարդ սեփականատիրոջ բացակայություն. Մարտական յուրաքանչյուր ուղի պետք է ունենա կանգառի կոճակ և վերանայման ցիկլ.

Սա գործնական օպերատորական տաքսոնոմիա է, ոչ պաշտոնական համընդհանուր ստանդարտ. Օգտագործեք այն՝ անվանելու, թե ինչ կկոտրվի, նախագծման վերահսկումներ ընտրելու գործիքներ ավելացնելուց առաջ, և իմանալու, թե ինչ չափել գործարկումից հետո.

Ինչու դեմոն անցնում է, իսկ մարտականը՝ ձախողվում

Դեմոն կարճ «հաջող ուղի» է՝ մաքուր մուտքերով և հսկող մարդով. Մարտական միջավայրը բազմաքայլ աշխատանք է իրական գործիքների վրա. CRM դաշտեր, տոմսեր, վերադարձներ, փոստարկղեր և ժամանակի ընթացքում փոփոխվող իրավունքներ.

Մոդելը մեկ բաղադրիչ է. Համակարգը, որ սովորաբար առաջինն է կոտրվում, սովորաբար հետևյալն է.

  • Միացումներ և auth, որոնք փչանում են դեմո շաբաթից հետո
  • Համատեքստ, որը վերցվում է, բայց երբեք չի ստուգվում գործողությունից առաջ
  • Բազմաքայլ պլաններ, որտեղ փոքր սխալները կուտակվում են
  • Ինքնավարություն, որը կարող է գրել առանց անվանված հաստատողի
  • Չափորոշիչներ, որոնք հետևում են մոդելի երկարախոսությանը, ոչ թե ավարտված աշխատանքի որակին

End-to-end հաջողությունը դժվար է նույնիսկ հանրային benchmark-ներում. WebArena-ում՝ իրատեսական վեբ-առաջադրանքների միջավայրում, GPT-4-ի վրա հիմնված գործակալը հասել է մոտ 14.41% end-to-end առաջադրանքի հաջողության՝ մարդկանց մոտ 78.24%-ի դիմաց այդ benchmark հավաքածուում (WebArena paper). Սա պնդում չէ բոլոր բիզնես գործակալների մասին. Սա ապացույց է, որ բազմաքայլ tool օգտագործումը ավելի դժվար է, քան թվում է chat-ի արձանագրությունից.

Պատկերավոր կուտակային հաշվարկ (ոչ Northstar KPI). Եթե յուրաքանչյուր քայլը ճիշտ է 85% դեպքերում, և քայլերը անկախ են, տասը քայլ տալիս է մոտավորապես 0.85^10 ≈ 20% end-to-end հաջողություն. Իրական աշխատանքային հոսքերն ավելի խառնաշփոթ են, քան այդ բանաձևը, բայց ուղղությունը պարզ է. բազմաքայլ ուղիներին պետք են դարպասներ և վերականգնում, ոչ միայն ավելի շատ ինքնավարություն.

DEMO-ONLY PATH (happy path, human watching)
  Clean input --> Agent --> Tool sandbox --> Fluent answer
       |              |            |
       v              v            v
  no schema rot   no write tiers   no post-run quality gate
  Result: looks successful; production path never designed

PRODUCTION PATH (multi-step, real tools)
  Live request --> Workflow map --> Agent + scoped tools
                        |                    |
                        v                    v
                 Tool of record      Approval gate / stop switch
                        |                    |
                        v                    v
                 Outcome + audit --> Review / eval loop --> Owner on-call
  Failure surfaces: wrong write, stale context, ungated irreversible, silent rework

Նկար. միայն դեմո ուղի ընդդեմ մարտական վերահսկվող ուղու. Դեմոները օպտիմիզացվում են վերահսկվող «հաջող ուղու» համար. մարտականը ձախողվում է, երբ բացակայում են միացումները, գրառման մակարդակները, սեփականատերերը և վերանայման ցիկլերը.

Դեմո ընդդեմ մարտականի ամբողջական հակադրության համար տեսեք AI գործակալ. դեմո ընդդեմ մարտական.

Արդյունաբերական խարիսխներ (կարդացեք ուշադիր)

Օգտագործեք առաջնային աղբյուրները որպես ընդհանուր բառապաշար, ոչ որպես վիճակագրության պատ.

  • Gartner (հունիս 2025) կանխատեսում է, որ agentic AI նախագծերի ավելի քան 40%-ը կչեղարկվի մինչև 2027-ի վերջը՝ աճող ծախսերի, անհասկանալի բիզնես արժեքի կամ անբավարար ռիսկի վերահսկումների պատճառով, ոչ թե «մոդելները հիմար են» (Gartner press release).
  • Microsoft AI Red Team-ը հրապարակել է agentic AI համակարգերում ձախողման ռեժիմների տաքսոնոմիա (PDF) և v2.0 թարմացում (v2 PDF). Օգտագործեք զույգը որպես ընդհանուր բառապաշար (v1 բազա գումարած v2 լրացումներ, ինչպես goal hijacking, session contamination և MCP/plugin չարաշահում). ռեժիմների մանրամասները՝ ստորև տաքսոնոմիայում և անվտանգության քարտեզում.
  • OWASP-ը փաստաթղթավորում է Excessive Agency-ն LLM Top 10-ում և հրապարակում է OWASP Top 10 for Agentic Applications (2026), ինչպես նաև agentic սպառնալիքներ և մեղմացումներ.
  • MAST-ը (Cemri et al.) վերլուծում է multi-agent ձախողումները՝ 14 ռեժիմ երեք կատեգորիայում, 1600+ նշված հետքերի վրա, բարձր inter-annotator համաձայնությամբ (κ = 0.88) (arXiv:2503.13657).

Այս աղբյուրները խարիսխներ են լեզվի և նախագծման համար. Դրանք չեն փոխարինում ձեր գործընթացների քարտեզը, հաշվառման համակարգերը և անվանված սեփականատերերին.

Ինչպիսին է լավը

  • Գործընթացների քարտեզ գոյություն ունի կառուցումից առաջ
  • Անդառնալի գործողություններն ունեն սեփականատերեր և դարպասներ
  • Հաշվառման համակարգերը հստակ են
  • Հաջողությունը սահմանված է որպես ավարտված աշխատանքի որակ, ոչ թե մոդելի երկարախոսություն

Ինչպիսին է վատը

  • Դեմո թատրոն առանց մարտական ուղու
  • Ավտոմատացումներ առանց սեփականատիրոջ
  • Հորինված չափորոշիչներ գործառնական ապացույցների փոխարեն

Եթե ձեր ընթացիկ գործակալային stack-ն ավելի մոտ է «վատին», դադարեցրեք գործիքներ ավելացնելը. Քարտեզագրեք մեկ ուղի, ապա նախագծեք դարպասները.

Մարտական ձախողման ռեժիմների տաքսոնոմիա

Production AI գործակալը շրջապատված է պայմանագրերի, թույլտվությունների, դիտարկելիության, դադարի, վերականգնման և մարդկային պատասխանատվության շերտերով

Զսպման հայեցակարգային մոդել. մեկ guard-ը չի որսում բոլոր failure mode-երը, ուստի գործակալին պետք են վերահսկողության մի քանի անկախ շերտեր։

Ստորև ցանկը բիզնես գործակալների համար գործնական օպերատորական հավաքածու է (CRM գրառումներ, աջակցություն, ops ավտոմատացում). Այն միավորում է միջաղբյուրային համաձայնությունը մարտական թեմաների հետ. Չի պնդում, որ ամբողջական արդյունաբերական ստանդարտ է.

1. Tool-ի սխալ օգտագործում / սխալ գրառումներ

Գործակալը ընտրում է սխալ tool, սխալ արգումենտներ կամ գրում է սխալ գրառման վրա. Բիզնես հոսքում սա նման է սխալ CRM կոնտակտի թարմացման, սխալ տոմսի փակման կամ սխալ ալիքում գրառման.

Վնասի շառավիղ. վնասված հաշվառման համակարգ, հաճախորդի վստահության վնաս, մաքրման աշխատանք.

Նախագծման դարպաս. նվազագույն իրավունքներով tool շրջանակներ. dry-run կամ draft ռեժիմ գրառումների համար. հաստատում բարձր ազդեցության tool-երի վրա.

Հայտնաբերում. tool-կանչերի աուդիտ լոգեր՝ target ID-ներով. գրառումից հետո վալիդացիա՝ ակնկալվող schema-ի և բիզնես կանոնների դեմ.

2. Վատ retrieval / չստուգված համատեքստ, որի վրա գործում են

Retrieval-ը վերադարձնում է հնացած, մասնակի կամ անտեղի համատեքստ. Գործակալը այն ընդունում է որպես ճշմարտություն և գործում է վստահությամբ.

Վնասի շառավիղ. սխալ պատասխաններ, որոնք բերում են սխալ գործողությունների. լուռ policy խախտումներ.

Նախագծման դարպաս. առանձնացրեք «վերցնել»-ը «գործել»-ից. պահանջեք citations կամ աղբյուրի ID-ներ հետևանքային որոշումների համար. allowlist վստահելի corpus-ների համար.

Հայտնաբերում. retrieval որակի նմուշներ. mismatch հաճախականություն մեջբերված աղբյուրների և վերջնական գործողությունների միջև.

3. Փխրուն միացումներ (schema, auth, timeouts)

API-ները փոխում են դաշտեր, token-ները ժամկետանցվում են, rate limit-ներ են հայտնվում, կամ polling-ը կանգնեցնում է հոսքը. Դեմոները օգտագործում են կայուն sandbox-ներ. մարտական միացումները փչանում են.

Վնասի շառավիղ. մասնակի run-եր, կախված հերթեր, կասկադային retry-եր, բացակա թարմացումներ.

Նախագծման դարպաս. health check-եր, schema պայմանագրեր, հստակ timeout և backoff քաղաքականություն, circuit breaker-ներ.

Հայտնաբերում. միացման սխալների հաճախականություն, auth ժամկետանցման ահազանգեր, timeout histogram-ներ, dead-letter հերթեր.

4. Կուտակվող բազմաքայլ սխալ

Յուրաքանչյուր քայլ «մեծ մասամբ ճիշտ» է, բայց համատեղ ուղին ձախողվում է. Տեսեք վերևի պատկերավոր 0.85^n հաշվարկը.

Վնասի շառավիղ. սխալ վերջնական վիճակ, որը ոչ մի առանձին քայլ չի նշել որպես ձախողում.

Նախագծման դարպաս. checkpoint-եր կրիտիկական քայլերից հետո. replan միայն թույլատրելի շրջանակներում. մարդու դարպաս անդառնալի commit-ից առաջ.

Հայտնաբերում. քայլի մակարդակի հաջողություն ընդդեմ ուղու մակարդակի հաջողության. offline ուղու eval-եր՝ գրանցված հետքերի վրա.

5. Համատեքստի կորուստ / session contamination

Կարևոր սահմանափակումներ դուրս են գալիս պատուհանից, կամ ավելի վաղ session-ի տվյալները կողմնակալություն են մտցնում հետագա քայլերում. Microsoft-ի agentic տաքսոնոմիան session context contamination-ը նշում է որպես առանձին ռեժիմ իր v2 թարմացման մեջ (Microsoft v2 blog).

Վնասի շառավիղ. policy-ի մոռացում, միջհաճախորդային արտահոսքի ռիսկ, անհետևողական որոշումներ մեկ session-ում.

Նախագծման դարպաս. խիստ session սահմաններ. կառուցվածքային state օբյեկտներ. երբեք մի խառնեք անվստահելի բովանդակությունը նպատակի ալիքի հետ.

Հայտնաբերում. համատեքստի snapshot-եր հետքերում. անսպասելի նպատակի կամ policy փոփոխություններ session-ի մեջտեղում.

6. Նպատակի դրեյֆ / specification drift

Գործակալը հետապնդում է մոտ, բայց սխալ նպատակ («օգնել օգտատիրոջը» դառնում է «փակել տոմսը ցանկացած գնով»). Անվտանգության նպատակային goal hijacking-ը այն է, երբ անվստահելի բովանդակությունը շեղում է վերջնական նպատակը՝ միաժամանակ նմանվելով օգտակար առաջադրանքի ավարտի (Microsoft taxonomy v2 PDF). Prompt-ի կամ eval-ի դրեյֆը առանց վերանայման ցիկլի սովորաբար այստեղ երևում է որպես նպատակի կամ specification-ի դրեյֆ, իսկ հետո՝ որպես լուռ որակի բացթողումներ (ռեժիմ 8).

Վնասի շառավիղ. ավարտված աշխատանք, որը խախտում է սկզբնական բիզնես մտադրությունը.

Նախագծման դարպաս. անփոփոխ առաջադրանքի նպատակ. համեմատեք պլանը և գործողությունները սկզբնական նպատակի հետ. կանգնեցրեք նպատակի փոփոխության դեպքում.

Հայտնաբերում. նպատակ-ընդդեմ-գործողություն վերանայողներ. մարդու վերահաստատում, երբ պլանը փոխում է կատեգորիան.

7. Retry ցիկլեր և ծախսերի պայթյուններ

Tool-ի ձախողումները կամ անորոշ հաջողության չափանիշները գործարկում են անսահմանափակ retry-եր. Token-ի և API-ի ծախսը բարձրանում է, մինչ աշխատանքը դեռ չի ավարտվում.

Վնասի շառավիղ. բյուջեի այրում, rate-limit փոթորիկներ, աղմկոտ downstream համակարգեր.

Նախագծման դարպաս. առավելագույն փորձեր, առավելագույն ծախս մեկ run-ի համար, escalate-to-human բյուջեի խախտման դեպքում.

Հայտնաբերում. cost-per-success, retry խորություն, run տևողության outliers.

8. Լուռ որակի դեգրադացիա

Հոսքը վերադարձնում է success. Արդյունքը հոսուն է թվում. Downstream մարդիկ կամ հաճախորդները հետո կլանում են rework-ը.

LLM գործակալային համակարգերում լուռ ձախողման հետազոտությունը ուսումնասիրում է ձախողումներ, որոնք տեղի են ունենում առանց արտաքին adversarial trigger-ների և հեշտությամբ սխալ են վերագրվում մեկանգամյա bug-երին (silent failure paper).

Վնասի շառավիղ. վստահության էրոզիա, անտեսանելի rework, միջադեպի ուշ հայտնաբերում.

Նախագծման դարպաս. հաջողություն = ավարտված աշխատանքի որակի ստուգումներ, ոչ HTTP 200. sampling վերանայում live տրաֆիկի վրա.

Հայտնաբերում. rework հաճախականություն, հաճախորդի ուղղումներ, որակի rubric-ներ ավարտված աշխատանքների վրա - ոչ միայն chat satisfaction.

9. Կասկադային multi-agent / վերիֆիկացիայի ձախողումներ

Մեկ գործակալը վատ state է փոխանցում հաջորդին. Վերիֆիկատորները rubber-stamp են անում կամ ընդհանրապես չեն աշխատում. MAST-ը multi-agent ձախողումները խմբավորում է համակարգի նախագծման խնդիրների, inter-agent misalignment-ի և task verification-ի մեջ (MAST).

Վնասի շառավիղ. ուժեղացված սխալ դերերի միջև. դժվար root-cause վերագրում.

Նախագծման դարպաս. հստակ handoff պայմանագրեր. անկախ վերիֆիկացիա բարձր ազդեցության արդյունքների վրա. սկսեք single-agent-ից, երբ multi-ն անհրաժեշտ չէ.

Հայտնաբերում. handoff schema ձախողումներ. վերիֆիկատորի անհամաձայնության հաճախականություն. ուղու հետքեր գործակալների միջև.

10. Excessive agency / բացակա human-in-the-loop դարպասներ

Գործակալն ունի ավելի շատ tool-եր, իրավունքներ կամ ինքնավարություն, քան առաջադրանքը պահանջում է. OWASP-ը Excessive Agency-ն շրջանակում է ավելորդ ֆունկցիոնալության, իրավունքների և ինքնավարության շուրջ (OWASP LLM Top 10, նախագծի ակնարկ՝ owasp.org).

Վնասի շառավիղ. անդառնալի գործողություններ առանց համաձայնության - վերադարձներ, ջնջումներ, հրապարակային ուղարկումներ, իրավունքների փոփոխություններ.

Նախագծման դարպաս. read / write / destructive մակարդակներ՝ անվանված հաստատողներով (տես մատրիցը ստորև).

Հայտնաբերում. չվերահսկվող անդառնալի գործողություններ. HitL skip հաճախականություն. հետին միջադեպերի վերանայում.

Հաստատման նախագծման խորությունը՝ մարդը ցիկլում (HitL). AI գործակալներ.

11. Injection, memory poisoning, tool supply-chain

Անվստահելի բովանդակությունը, թունավորված հիշողությունը կամ վնասակար/վտանգված tool-երն ու plugin-ները ղեկավարում են վարքը. Microsoft-ի v2 տաքսոնոմիան ընդգծում է այնպիսի ռեժիմներ, ինչպես agentic supply-chain compromise, MCP/plugin չարաշահում, memory poisoning և առնչվող հարձակումներ (Microsoft v2, v2 PDF). OWASP agentic նյութերը ծածկում են առնչվող application ռիսկերը (Agentic Top 10 2026, սպառնալիքներ և մեղմացումներ).

Վնասի շառավիղ. տվյալների արտահոսք, չարտոնված գրառումներ, երկարատև հիշողություն, որը նորից վարակում է հետագա run-երը.

Նախագծման դարպաս. tool սահմանումները և հիշողությունը վերաբերվեք որպես supply chain. pin և վերանայեք plugin-ները. մեկուսացրեք անվստահելի բովանդակությունը հրահանգներից.

Հայտնաբերում. անսպասելի tool գրանցումներ. հիշողության գրառման աուդիտներ. anomaly ահազանգեր նոր կարողությունների վրա.

12. Անսեփականատեր ավտոմատացումներ / անհասկանալի բիզնես արժեք

Ոչ ոք չի տիրապետում bot-ին pilot-ից հետո. Հաջողությունը slide metric է, ոչ թե ավարտված աշխատանքի չափորոշիչ. Սա Gartner-ի չեղարկման ռիսկի կազմակերպական զույգն է. անհասկանալի արժեքը և թույլ ռիսկի վերահսկումները սպանում են նախագծերը նույնիսկ երբ դեմոները լավ տեսք ունեն (Gartner).

Վնասի շառավիղ. լուռ մարտական պարտք, միջադեպի սեփականատեր չկա, kill switch չկա.

Նախագծման դարպաս. անվանված մարդ սեփականատեր յուրաքանչյուր ուղու համար. կանգառի կոճակը փաստաթղթավորված. արժեքը սահմանված որպես cycle time, rework և error rate մեկ ուղու վրա.

Հայտնաբերում. սեփականատիրոջ բացակայություն runbook-ներում. շաբաթական որակի վերանայում չկա. չափորոշիչներ միայն մոդելի արդյունքի երկարության մասին.

Հիմնական աղյուսակ

ՌեժիմԻնչպես է երևում բիզնես հոսքումՎնասի շառավիղՆախագծման դարպաս / վերահսկումԻնչպես եք հայտնաբերում
Tool-ի սխալ օգտագործում / սխալ գրառումներՍխալ CRM դաշտ, սխալ տոմսի փակումՎնասված գրառումներ, հաճախորդի վնասՍահմանափակ tool-եր, գրառման հաստատումTool աուդիտներ + գրառումից հետո ստուգումներ
Վատ retrieval, որի վրա գործում ենՀնացած policy որպես փաստՍխալ գործողություններ վստահությամբՎերցնել ≠ գործել. աղբյուրների թույլատրելի ցանկերՄեջբերում/գործողություն անհամապատասխանության նմուշներ
Փխրուն միացումներAuth ձախողում, schema դրեյֆ, timeoutsԿախված կամ մասնակի հոսքերՊայմանագրեր, health check-եր, breaker-ներՍխալի/timeout/auth ահազանգեր
Կուտակվող բազմաքայլ սխալՅուրաքանչյուր քայլ «ok», ուղին սխալՍխալ վերջնական վիճակCheckpoint-եր, ուղու eval-երՈւղու ընդդեմ քայլի հաջողության բաց
Համատեքստի կորուստ / contaminationSession-ի մեջտեղում policy մոռացում կամ biasԱնհետևողական կամ անապահով որոշումներSession սահմաններ, կառուցվածքային stateՆպատակի/policy փոփոխություն հետքերում
Նպատակի / specification դրեյֆՏոմսը փակված է, նպատակը բաց է թողնվածՄտադրության ձախողումԱնփոփոխ նպատակ, կանգ փոփոխության վրաՆպատակ-ընդդեմ-գործողություն վերանայում
Retry ցիկլեր / ծախսերի պայթյունԱնսահման tool retry-երԲյուջեի և rate-limit վնասԱռավելագույն ծախս/փորձեր, escalateՀաջողության արժեք, retry խորություն
Լուռ որակի դեգրադացիաSuccess դրոշ, վատ աշխատանքի արդյունքԹաքնված rework, վստահության կորուստՈրակի դարպասներ ավարտված աշխատանքի վրաRework, ուղղումներ, rubric-ներ
Կասկադային multi-agent ձախողումներՎատ handoff, թույլ վերիֆիկացիաՈւժեղացված բազմադերային սխալHandoff պայմանագրեր, անկախ վերիֆիկացիաԳործակալների միջև հետքեր
Excessive agency / HitL չկաRefund/delete առանց հաստատմանԱնդառնալի վնասՀաստատման մակարդակներ + սեփականատերերՉվերահսկվող անդառնալի իրադարձություններ
Injection / memory / supply chainԹունավորված հիշողություն կամ pluginԵրկարատև compromiseTool/memory supply-chain վերահսկումներՀիշողության/tool փոփոխության աուդիտներ
Անսեփականատեր / անհասկանալի արժեքՈրբ bot pilot-ից հետոՍեփականատեր չկա, kill switch չկաԱնվանված սեփականատեր, կանգառի կոճակ, ուղու KPI-ներԲացակա runbook սեփականություն

Անդառնալի գործողությունների մակարդակներ

Քարտեզագրեք յուրաքանչյուր tool կանչ մակարդակի՝ go-live-ից առաջ. Բացակա դարպասները սովորաբար նշանակում են, որ ամեն ինչ վերաբերվել է որպես «պարզապես գրառում».

ՄակարդակՕրինակներՀաստատման լռելյայնՍեփականատերԳրառում (logging)
ReadCRM որոնում, տոմս բերել, inventory ցանկԱվտո՝ թույլատրված շրջանակումՈւղու սեփականատերՀարցում + արդյունքի ID-ներ
Write (շրջելի կամ ցածր վնաս)Draft email, CRM թարմացման stage, ներքին նշումԱվտո կամ թեթև վերանայում ըստ policyՈւղու սեփականատերՄինչև/հետո դաշտեր
Write (բիզնես-կրիտիկական)Հաճախորդի email ուղարկել, deal stage փոխել, invoice draft թարմացնելՄարդու հաստատում կամ կրկնակի վերահսկումԲիզնես + ops սեփականատերԱնփոփոխ audit trail
Destructive / բարձր վնասRefund, delete, իրավունքի փոփոխություն, հրապարակային post, bulk mutateՀստակ մարդու հաստատում. երբեք լուռ ավտոRisk սեփականատեր + ուղու սեփականատերԱմբողջական audit + rollback պլան

Microsoft red-team պատումը human-in-the-loop bypass-ը համարում է agentic համակարգերում ամենահետևողականորեն շահագործվող ուղիներից (Microsoft v2 blog). Օպերատորի լեզվով. եթե համաձայնությունը կարող է հոգնեցվել, բաց թողնվել կամ երբեք չկապվել, վերևի մատրիցը թատրոն է.

FREE-FIRE PATH (missing gates)
  Request --> Agent --> Write tools (full scope) --> System of record
                              |
                              v
                     No approval, no stop switch
                     Exception = silent retry or ignore
  Outcome: irreversible action lands first; HitL bypass by design

GATED PATH (production default for high blast)
  Request --> Agent plans --> Read / draft tools
                    |
          +---------+---------+
          |                   |
          v                   v
   Safe tier:           Business-critical /
   auto within scope    destructive tier
                              |
                              v
                     Approval / exception queue
                     (named owner)
                     | approve | edit | reject |
                              v
                     Commit to tool of record
                              |
                              v
              Stop switch available anytime
              Audit trail + review / eval loop

Նկար. free-fire ուղի ընդդեմ վերահսկվող մարտական ուղու. Հաստատումը, կանգառի կոճակը և exception հերթը նստում են բարձր blast գրառումներից առաջ. free-fire-ը յուրաքանչյուր գրառումը վերաբերվում է որպես auto.

Անվտանգության և agency ռիսկեր պարզ լեզվով

Քարտեզագրեք անվտանգության բառապաշարը բիզնես գրառումների և համաձայնության վրա - ոչ red-team թատրոնի.

Անվտանգության / framework տերմինՕպերատորի իմաստԱռաջին վերահսկում
Excessive Agency (OWASP)Չափից շատ tool-եր, իրավունքներ կամ ինքնավարությունԿրճատեք շրջանակները. դարպասավորեք բարձր ազդեցության գործողությունները
HitL bypass (Microsoft)Հաստատումները բաց են թողնված, հոգնեցված կամ երբեք չեն կանչվելԽիստ դարպասներ destructive մակարդակների վրա
Goal hijackingԱնվստահելի բովանդակությունը շեղում է նպատակըԱռանձնացրեք նպատակի ալիքը տվյալներից
Session contaminationՎաղ աղբը կողմնակալություն է մտցնում հետագա քայլերումSession մեկուսացում. մաքրեք tool արդյունքը
Memory poisoningՎատ փաստերը մնում են և նորից հայտնվումՀիշողության գրառման policy + աուդիտներ
MCP / plugin / supply chainՎտանգված կամ գերլիազորված tool-երPin, վերանայում, least privilege plugin-երի համար

Սկսեք իրավունքներից և դարպասներից. Անվտանգության տաքսոնոմիայի խորությունը առանց գործընթացների քարտեզի դեռ առաքում է սխալ գրառումներ.

Multi-agent ձախողումներ (երբ multi-agent-ը սխալ fix է)

Ավելի շատ գործակալներ ավելացնելը չի շտկում չքարտեզագրված հոսքը. Այն բազմապատկում է handoff-երը.

MAST-ը multi-agent ձախողումները կազմակերպում է երեք կատեգորիայի մեջ (arXiv:2503.13657).

  1. Համակարգի նախագծման / specification խնդիրներ - անհասկանալի դերեր, մշուշոտ հաջողության չափանիշներ, փխրուն orchestration
  2. Inter-agent misalignment - գործակալները աշխատում են հակառակ նպատակներով կամ կորցնում են համատեքստը handoff-երի միջև
  3. Task verification - թույլ կամ բացակա ստուգումներ ավարտված արդյունքի վրա

Multi-agent-ը հաճախ սխալ fix է, երբ.

  • Դուք դեռ չունեք մեկ հուսալի single-agent ուղի մեկ հոսքի վրա
  • Դերերը նշված չեն հաշվառման համակարգերով և հաջողության սահմանումներով
  • Չունեք անկախ վերիֆիկացիայի քայլ բարձր ազդեցության արդյունքների համար
  • Սեփականությունը անհասկանալի է (ո՞վ է վերագործարկում swarm-ը գիշերվա ժամը 2-ին)

Ճարտարապետության ընտրության մանրամասների համար տեսեք բազմագործակալ ընդդեմ մեկ գործակալ.

Հայտնաբերում և չափում

Դուք չեք կարող նախագծել լուռ ձախողման դեմ, եթե հաջողությունը միայն «run-ը ավարտվեց» է.

Օպերատորի հայտնաբերման քարտեզ (բավարար է ձախողումները խմբավորելու համար - ոչ observability product tutorial).

  1. Հետևեք ուղուն - session ID, պլանի քայլեր, tool կանչեր, հաստատումներ, վերջնական բիզնես արդյունք.
  2. Խմբավորեք ձախողումները - նույն սխալ tool, նույն միացման սխալ, նույն որակի rubric miss.
  3. Root-cause տաքսոնոմիայում - քարտեզագրեք cluster-ը վերևի ռեժիմներից մեկին.
  4. Մարտական ձախողումները դարձրեք eval-եր - սառեցրեք օրինակներ, որոնք չպետք է regress անեն հաջորդ release-ից առաջ.

Գործիքավորման խորության համար (լոգեր, հետքեր, redaction սահմաններ) տեսեք գործակալի observability. լոգեր և հետքեր.

Չափեք նախ մեկ մարտական ուղու վրա.

ՉափորոշիչԻնչու է կարևոր
Cycle timeԱվարտված աշխատանքն արագացե՞լ է end to end
Rework rateՈրքա՞ն հաճախ մարդիկ հետ են շրջում կամ վերաանում գործակալի արդյունքը
Error / incident rateՍխալ գրառումներ, policy բացթողումներ, հաճախորդին տեսանելի ձախողումներ
Չվերահսկվող անդառնալի գործողություններՊետք է զրո լինի հաստատված policy-ից դուրս
Cost per successful completionՄակերեսավորում է retry ցիկլերն ու thrash-ը

Առաջ մղեք այս mid-lifecycle չափորոշիչները vanity model score-ներից առաջ. Գործարկումից առաջ eval նախագծումը ծածկված է ինչպես գնահատել AI գործակալները go-live-ից առաջ.

Նախագծման ստուգաթերթ (կառուցման կարգ)

  1. Գործընթացների քարտեզ - իրական քայլեր, բացառություններ, գործիքներ և ձախողման արժեք.
  2. Հաշվառման համակարգեր - անվանեք համակարգերը, որոնց վրա կարելի է գրել.
  3. Անդառնալի մակարդակներ - read / write / destructive՝ սեփականատերերով.
  4. Մարդ սեփականատեր - մեկ անվանված անձ ուղու համար, ոչ «AI թիմը».
  5. Կանգառի կոճակ - ինչպես կանգնեցնել գործակալը առանց credentials որսալու.
  6. Eval և վերանայման ցիկլ - offline case-եր գումարած live sampling.
  7. Հաջողության սահմանում - ավարտված աշխատանքի որակ մեկ ուղու վրա (cycle time, rework, errors).
[Workflow map]
      |
      v
[Agent + scoped tools] --> [Tool of record]
      |                         |
      v                         v
[Approval gate] <---- stop switch (human)
      |
      v
[Outcome + audit] --> [Review / eval loop]

Նկար. վերահսկվող մարտական գործակալի ուղու կառուցման կարգի ամփոփում. Քարտեզը և հաշվառման համակարգերը գալիս են առաջինը. կանգառի կոճակը և վերանայման ցիկլը մնում են միացված go-live-ից հետո.

Աշխատանքային օրինակ (հիպոթետիկ)

Սցենար. Աջակցության գործակալին թույլատրվում է թարմացնել CRM նշումները և փակել տոմսերը՝ լուծման draft-ից հետո. Այն չպետք է թողարկի refund-եր առանց հաստատման.

Ձախողում. Գործակալը փակում է VIP տոմսը որպես «resolved»՝ օգտագործելով հնացած FAQ snippet և երբեք չի ստեղծում խոստացված follow-up task-ը. Run status-ը success է. Երկու օր անց հաճախորդը escalate է անում. մարդը վերաբացում է գործը և վերաանում աշխատանքը.

Մասնակից ռեժիմներ. վատ retrieval, որի վրա գործել են. լուռ որակի դեգրադացիա. բացակա write-tier դարպաս VIP հաշիվների «փակել տոմսը»-ի վրա.

Վնասի շառավիղ. հաճախորդի վստահություն, SLA miss, rework ավագ աջակցության կողմից.

Նախագծման դարպաս. VIP տոմսի փակումը պահանջում է մարդու հաստատում. լուծման draft-երը պետք է մեջբերեն ընթացիկ policy փաստաթղթի ID. follow-up task-ի ստեղծումը կոշտ post-condition է՝ փակումը թույլատրելուց առաջ.

Հայտնաբերում. rework/reopen rate գործակալի փակած տոմսերի վրա. փակված տոմսերի sampling առանց կապված follow-up task-երի. rubric fail, երբ մեջբերված policy-ն ավելի հին է, քան սահմանված freshness պատուհանը.

Հաճախորդների անուններ չկան - սա պիտակցված հիպոթետիկ է նախագծման պրակտիկայի համար.

Ինչպես է օգնում Northstar-ն

Northstar-ն նախագծում և ներդնում է գործակալային համակարգեր ինժեներիայի և գործառնությունների հետ միասին - discovery-ից մինչև մարտական ուղիներ և AI visibility. Մենք սկսում ենք գործընթացների քարտեզից, հաշվառման համակարգերից, դարպասներից և սեփականատերերից - ոչ ավելի մեծ մոդելից կամ ևս մեկ դեմոյից. Տեսեք լուծումներ և hub-ը մարտական AI գործակալներ բիզնեսի համար.

Եթե գործակալները դեմոներում լավ տեսք ունեն, բայց մարտականում rework են ստեղծում, քարտեզագրեք մեկ հոսք՝ դարպասներով և սեփականատերերով, գործիքներ ավելացնելուց առաջ. Առնչվող որոշումների գրառումներ. ստուդիա ընդդեմ ներքին թիմ և ստուդիա ընդդեմ ֆրիլանսերներ.

FAQ

  • Ոչ. Գործիքներն առանց գործընթացների քարտեզի դեռ ձախողվում են. Լիցենզիաները և մոդելի հասանելիությունը չեն անվանում անդառնալի քայլերը, սեփականատերերին կամ հաջողությունը որպես ավարտված աշխատանքի որակ.