Բլոգ

Թարմացվել է 10 րոպե կարդալուԱնվտանգություն և կառավարումՈւսուցում

Human-in-the-loop AI գործակալներ. հաստատում, էսկալացիա և վերահսկում

Ինչպես են աշխատում human-in-the-loop AI գործակալները, որ գործողություններն են պահանջում հաստատման դարպաս, երբ է պետք էսկալացիա, և ինչպես ավելացնել HITL վերահսկում՝ առանց առօրյա աշխատանքը արգելափակելու։

Northstar

Northstar-ն AI agent systems ստուդիա է։ Ալեքսը՝ engineering/product, Ջորդանը՝ operations/workflow fit։ Production գործակալներ առկա tools-ում։

Alex Morgan · LinkedIn · Northstar

Վերահսկիչ դարպասի դիագրամ AI գործակալի համակարգում մարդու հաստատման համար

Ուղիղ պատասխան

Human-in-the-loop AI գործակալը ավտոմատացնում է առօրյա քայլերը, բայց կանգ է առնում մարդուն պատկանող որոշումից կամ բարձր ռիսկի գործողությունից առաջ։ Մարդը կարող է հաստատել, մերժել կամ խմբագրել առաջարկված գործողությունը՝ ունենալով գնահատման համար անհրաժեշտ ապացույցները։ Այնուհետև գործակալը կատարում է հաստատված գործողությունը և գրանցում արդյունքը։

Դարպաս դրեք այն գործողություններին, որոնք կարող են տեղափոխել գումար, ուղարկել արտաքին հաղորդագրություն, փոխել թույլտվություններ, հրապարակել բովանդակություն, ջնջել տվյալներ, փոխել հաշվառման համակարգը կամ ստեղծել իրավական պարտավորություն։ Ներքին որոնումը, դասակարգումը, ամփոփումը և sandbox-ում գտնվող սևագրերը թողեք ավտոմատ, երբ դրանք արտաքին կողմնակի ազդեցություն չեն ստեղծում։ Նպատակը ազդեցության շառավիղը սահմանափակելն է, ոչ թե մոդելի ամեն պատասխանը կանգնեցնելը։

Մարդու հաստատումը և էսկալացիան լուծում են տարբեր խնդիրներ։ Հաստատումը նախապես նախագծված վերահսկիչ կետ է հայտնի ռիսկային գործողությունից առաջ։ Էսկալացիան բացառության ուղի է, երբ գործակալը անորոշ է, չունի պարտադիր տվյալներ, հանդիպում է քաղաքականության հակասության կամ չի կարող անվտանգ ավարտել խնդիրը։ Production համակարգին սովորաբար երկուսն էլ պետք են։

Runtime HITL և training-time HITL

Ընդհանուր առմամբ human-in-the-loop նշանակում է, որ մարդիկ մասնակցում են ավտոմատացված համակարգերի աշխատանքին, վերահսկմանը կամ որոշումների կայացմանը (IBM)։ Մեքենայական ուսուցման կրթության մեջ դա հաճախ training-time աշխատանք է՝ տվյալների պիտակավորում, նախընտրությունների հետադարձ կապ (RLHF) կամ active learning։ Production AI գործակալների համար runtime HITL-ը այլ է. գործակալը առաջարկում է գործիքի գործողություն, աշխատահոսքը կանգ է առնում, և մարդը որոշում է իրական կողմնակի ազդեցությունից առաջ։ Այս նյութը runtime վերահսկիչ դարպասների մասին է, ոչ թե մոդելի ուսուցման օղակների։

Որտեղ է մարդը ճարտարապետության մեջ

AI գործակալի պլանն ու ապացույցների փաթեթը հասնում են դադարի դարպաս, որտեղ մարդը հաստատում, մերժում կամ վերանայման է վերադարձնում գործողությունը

Ստուգողին պետք են որոշման համատեքստն ու ապացույցները այն պահին, երբ գործողությունը դեռ կարելի է դադարեցնել։

Հարցում
   |
   v
Գործակալի պլան -> միայն-կարդալու գործիքներ -> ապացույցների փաթեթ
   |                                          |
   | անվտանգ, շրջելի                          | ռիսկային, արտաքին, անորոշ
   v                                          v
Ավտոկատարում                           Մարդու ստուգման հերթ
   |                                   | հաստատել | խմբագրել | մերժել
   |                                   v         v        v
   +----------------------------> Վերահսկվող գործողություն  Էսկալացիա
                                          |
                                          v
                                 Աուդիտի մատյան + արդյունքի չափումներ

Նկար. վերահսկիչ դարպասի հոսք AI գործակալի համակարգում մարդու հաստատման համար։ Անվտանգ, շրջելի աշխատանքը կարող է ավտոմատ կատարվել. ռիսկային կամ անորոշ աշխատանքը մտնում է ստուգման հերթ՝ կողմնակի ազդեցությունից առաջ։

Ստուգման հերթը համակարգի մասն է, ոչ թե գործարկումից հետո ավելացված մուտքային արկղ։ Յուրաքանչյուր տարր պետք է ցույց տա սկզբնական հարցումը, առաջարկվող գործողությունը, համապատասխան գրառումները, քաղաքականության ստուգումները, վստահության կամ անորոշության ազդանշանները և հաստատման հետևանքը։ Հաստատողը չպետք է գործակալի տրամաբանությունը վերականգնի հում մատյաններից։

Գործնական բաժանումը propose, հետո commit է. գործակալը վերադարձնում է կառուցվածքային մտադրություն և պարամետրեր. մարդը (կամ քաղաքականությունը) կարող է խմբագրել դրանք. միայն դրանից հետո հավելվածը կատարում է գործիքի կանչը։ Հարթակային արտադրանքները նույն գաղափարն արտահայտում են որպես օգտատիրոջ հաստատում կրիտիկական գործիքներից առաջ կամ control-ի վերադարձ, երբ հավելվածը գործողությունը կատարում է մարդու մուտքից հետո (AWS Bedrock Agents user confirmation; return of control)։ Սա օգտագործեք որպես նախշերի լեզու, ոչ թե որպես պահանջ ընդունել կոնկրետ ամպային արտադրանք։

Որ գործողությունները սովորաբար դարպաս են պահանջում

  • Արտաքին ուղարկումներ. էլ. փոստ, չաթի պատասխան, հաշիվ, ծանուցում և զանգվածային outreach։
  • Գումար. վճարում, վերադարձ, վարկ, գնի փոփոխություն և գնման պատվեր։
  • Մուտք. դերի փոփոխություն, հավատարմագրերի տրամադրում, հաշվի կասեցում և production տեղակայում։
  • Հաշվառման համակարգեր. CRM փուլի փոփոխություն, տոմսի փակում, պահեստի թարմացում և կործանարար տվյալների գրառում։
  • Հանրային կամ կարգավորվող բովանդակություն. հրապարակում, իրավական ձևակերպում, բժշկական կամ ֆինանսական պնդումներ և զգայուն հաճախորդային պատասխան։
  • Անշրջելի գործողություններ. ջնջում, չեղարկում, պայմանագրի ընդունում կամ գործողություն, որի հետադարձումը դանդաղ է կամ թերի։

Ցածր ռիսկի աշխատանքը կարող է մնալ ավտոմատ, երբ այն շրջելի է և սահմանափակված։ Օրինակներ են փաստաթղթերի վերցնելը, տոմսի դասակարգումը, պատասխանի սևագիրը, որը չի կարող ուղարկվել, լիդերի դասակարգումը վաճառողի համար կամ զանգի ամփոփումը այն մարդու համար, ով արդեն պատասխանատու է հաջորդ քայլի համար։

Հաստատո՞ւմ, թե էսկալացիա. որոշումների աղյուսակ

ԻրավիճակՀամակարգի արձագանքՄարդու դերըՇարունակելու պայմանը
Հայտնի բարձր ռիսկի գործողությունՀաստատում խնդրել կատարումից առաջՀաստատել, խմբագրել կամ մերժելԼիազորված դերի հստակ որոշում
Պարտադիր տվյալները բացակայում ենԷսկալացիա՝ առանց կողմնակի ազդեցություն առաջարկելուՏալ տվյալներ կամ ընտրել պահեստային տարբերակՊարտադիր դաշտեր կամ փաստաթղթավորված բացառություն
Քաղաքականության հակասությունԿանգ և էսկալացիաՈրոշել, թե որ քաղաքականությունն է գերակաԳրանցված քաղաքականության որոշում
Ցածր վստահություն շրջելի առաջադրանքումՇարունակել կամ ընտրովի ուղարկել ստուգման՝ ըստ քաղաքականությանՍտուգել ընտրված արդյունքներըՇեմը մնում է սահմանների ներսում
Կրկնվող գործիքի խափանումԿանգնեցնել կրկնությունները և էսկալացիաՈւղղել ինտեգրացիան կամ փակել ձեռքովԳործիքի առողջությունը վերականգնված է կամ ձեռքով ավարտ
Անվտանգ, դետերմինիստիկ քայլԱվտոմատ կատարումՀամաժամանակյա ստուգում պետք չէՄիայն սովորական մոնիթորինգ

Վստահությունը միայնակ չպետք է որոշի, թե արդյոք գործողությունը դարպասի տակ է։ Բարձր վստահությամբ մոդելը նույնպես կարող է սխալվել, իսկ ցածր վստահությամբ դասակարգումը կարող է անվնաս լինել, եթե վերջնական որոշումը մարդն է կայացնում։ Ռիսկը գալիս է գործողությունից, դրա շրջելիությունից և ազդեցությունից։

Հաստատման դարպասի նվազագույն նախագիծ

  1. Հստակ անվանեք գործողությունը և դրա առավելագույն ազդեցության շառավիղը։
  2. Քաղաքականությունը սահմանեք դիտարկելի պայմաններով, ոչ թե «օգտագործեք դատողություն» անորոշ հրահանգով։
  3. Հաստատողին նշանակեք դերով և թույլտվությամբ, ոչ թե նրանով, թե ով է հիմա առցանց։
  4. Կառուցեք ապացույցների փաթեթ մուտքերով, նախատեսված կողմնակի ազդեցություններով, աղբյուրներով, վավերացման արդյունքներով և նախադիտումով, թե ինչ կլինի, եթե մարդը հաստատի։
  5. Տվեք հաստատման, մերժման և խմբագրման ուղիներ՝ յուրաքանչյուր որոշման պատճառով։
  6. Սահմանեք SLA և հնացած տարրի ուղի, որպեսզի հերթում գտնվող աշխատանքը լուռ չկորչի (հիշեցնել, վերանշանակել, ավարտել ձեռքով կամ անվտանգ չեղարկել. երբեք լուռ ավտոկատարում միայն ժամկետի սպառման պատճառով)։
  7. Գրանցեք առաջարկը, ստուգողը, որոշումը, վերջնական գործիքի կանչը և արդյունքը մեկ correlation ID-ի տակ։
  8. Դարպասը թուլացնելուց առաջ չափեք վերասահմանման տոկոսը, հերթի ժամանակը, միջադեպերը և հաջող ավարտը։

Նույն նախշը production AI գործակալի սահմանող վերահսկիչներից մեկն է։ Այն պետք է նախագծել գործիքների թույլտվությունների, evals-ի, դիտարկելիության և կանգառի անջատիչի հետ միասին։

Օրքեստրացիայի շերտերը, որոնք աջակցում են կայուն դադարի և վերսկսման, սա կոդում հեշտացնում են (օրինակ՝ մարդու հաստատման աշխատահոսքեր ազդանշաններով և ժամանակաչափերով Temporal-ի HITL cookbook-ում)։ Արտադրանքի ընտրությունը երկրորդական է քաղաքականության նկատմամբ. անվանված պատասխանատու, ապացույցների փաթեթ, SLA և ոչ ավտոկատարում միայն այն պատճառով, որ ժամանակը սպառվել է։

Հասունության նախշեր մեկ դարպասից այն կողմ

Երբ բազային դարպասը աշխատում է, կարող եք ավելի առաջադեմ վերահսկում ավելացնել առանց ամբողջ գործակալը վերագրելու.

ՓուլՆախշԵրբ է օգնում
BaselineՄեկ հաստատում անվանված կողմնակի ազդեցությունից առաջԼռելյայն արտաքին, ֆինանսական, մուտքի կամ անշրջելի գործողությունների համար
Dual controlԵրկու լիազորված դեր բարձր ազդեցության շառավիղի համարՇեմից բարձր վճարումներ, production մուտք, կարգավորվող հրապարակում
Sampled reviewԱվտոկատարում ցածր ռիսկի դասերի համար. ընտրանք աուդիտի համարԾավալը աճում է, բայց մնացորդային ռիսկը մնում է չափելի
Exception-onlyՄարդ միայն քաղաքականության բացթողման, գործիքի խափանման կամ անոմալիայի դեպքումՀասուն ուղիներ կայուն վերասահմանման և միջադեպերի տոկոսներով
Propose / commit splitՄտադրությունը և պարամետրերը խմբագրելի են commit-ից առաջՍտուգողները ուղղում են վատ պարամետրերը առանց ամբողջական մերժում-և-վերագործարկում

Այս փուլերը պարտադիր չեն։ Մի անցեք միայն-բացառություններով ստուգման, մինչև մատյանները չցույց տան, որ գործողությունների դասը անվտանգ է իրական բեռնվածության տակ։ Որոշ գործողություններ պետք է մնան կրկնակի հաստատված մշտապես։

Վերահսկման համատեքստ (ոչ իրավական խորհուրդ)

Մարդու վերահսկումը հանրային ռիսկի շրջանակներում նախագծման նպատակ է, ոչ թե մեկ կտտոցով համապատասխանության նշում։ EU AI Act-ի Article 14-ը վերաբերում է մարդու վերահսկմանը high-risk AI համակարգերի համար, որպեսզի ֆիզիկական անձինք կարողանան վերահսկել աշխատանքը և միջամտել անհրաժեշտության դեպքում (Article 14 text; լրացուցիչ ինստիտուցիոնալ շրջանակ. EC AI Act service desk on Article 14)։ ԱՄՆ-ում NIST AI Risk Management Framework-ը կամավոր մոտեցում է AI ռիսկի քարտեզագրման, չափման և կառավարման համար, ներառյալ մարդու վերահսկումը որպես վստահելի շահագործման մաս (NIST AI RMF hub; AI RMF 1.0 PDF

Այս հոդվածը չի որոշում, թե ընթերցողի համակարգը high-risk է EU AI Act-ի տակ, թե արդյոք դարպասի նախագիծը «համապատասխան» է։ Կանոնակարգը և շրջանակները վերաբերվեք որպես համատեքստ. կիրառելիությունը որոշում է իրավական խորհրդատուն։ Production գործակալների համար ինժեներական թարգմանությունը կոնկրետ է. դադար ազդեցությունից առաջ, իրավասու ստուգողին տվեք օգտագործելի ապացույցներ, գրանցեք որոշումը և պահեք կանգառի ուղի։

Հաճախ հանդիպող խափանման ռեժիմներ

Դարպաս ամեն ինչի վրա

Եթե յուրաքանչյուր ներքին սևագիր հաստատում է պահանջում, գործակալը դառնում է դանդաղ չաթ ինտերֆեյս, իսկ ստուգողները սկսում են սեղմել «հաստատել» առանց կարդալու։ Այդ ձևական դրոշմակնքման ռիսկը հայտնի սահմանափակում է չափազանց լայն HITL նախագծերի համար (Databricks on HITL limitations)։ Դարպասը տեղափոխեք առաջին իմաստալից կողմնակի ազդեցության մոտ։

Դարպաս չդնել ոչնչի վրա

Մեկ սխալ գործիքի կանչը մինչև հայտնաբերումը կարող է ստեղծել հարյուրավոր հաճախորդային հաղորդագրություններ կամ վնասված գրառումներ։ Արտաքին և անշրջելի գործողությունների համար սկսեք զգուշավոր քաղաքականությամբ, հետո վերահսկիչները թուլացրեք չափված արդյունքներով։ Կապված production գործակալի խափանման ռեժիմները հաճախ սկսվում են անսահմանափակ գործիքներով և առանց մարդու կանգառի։

Էսկալացիան համարել մերժում

Գործակալին երբեմն պետք է բացակայող տեղեկություն, ոչ թե այո-կամ-ոչ որոշում։ Ստուգողին տվեք համատեքստ ավելացնելու, գործը ուղղորդելու կամ ձեռքով ավարտելու ճանապարհ։

Անվանված պատասխանատու չկա

Հերթն առանց աշխատակազմի մոդելի վերահսկում չէ։ Անվանեք գործառնական դերը, պահեստայինը, արձագանքման ժամանակը և այն մարդուն, ով կարող է փոխել քաղաքականությունը։

Թույլ ապացույցների փաթեթներ

Եթե երևում է միայն առաջարկված պատասխանը, ստուգողները փաստեր են փնտրում այլ համակարգերում, և ձևական դրոշմակնքումը աճում է։ Համապատասխան աղբյուրային գրառումները և քաղաքականության արդյունքը պահեք գործողության կողքին։

Աուդիտի հետք չկա

Առանց կապակցված առաջարկի, որոշման, գործողության և արդյունքի իրադարձությունների թիմը չի կարող ախտորոշել միջադեպերը կամ հասկանալ, թե որ դարպասներն են ավելորդ։ Դիտարկելիության շերտը պետք է ներառի մարդկային որոշումները։

Ներդրման ստուգաթերթ

  • Գրանցեք բոլոր գործիքային գործողությունները և նշեք, արդյոք դրանք արտաքին, ֆինանսական, կործանարար, կարգավորվող կամ դժվար շրջելի են։
  • Սահմանեք թույլատրված, արգելված, հաստատում պահանջող և միայն-էսկալացիայի գործողությունների դասեր։
  • Հաստատողների համար ստեղծեք դերային մուտք և հաստատումը տարանջատեք համակարգի վարչարարությունից։
  • Նախագծեք ստուգման քարտ բավարար ապացույցներով և ճշգրիտ կողմնակի ազդեցության նախադիտումով։
  • Ավելացրեք idempotency keys, որպեսզի կրկնակի հաստատումը կրկնակի գործողություն չստեղծի (տես նաև idempotency, retries և queues
  • Սահմանեք կրկնության սահմաններ և կրկնվող խափանումները ուղղորդեք մարդուն պատկանող բացառությունների հերթ։
  • Որոշումները և խմբագրումները պահեք որպես պիտակավորված տվյալներ evals-ի համար, ոչ թե որպես չկառուցված չաթի պատմություն։
  • Փորձարկեք հաստատման, մերժման, խմբագրման, ժամկետի սպառման, կրկնակի կտտոցի, անհասանելի գործիքի և չլիազորված ստուգողի ուղիները։
  • Գործարկեք shadow mode, հետո canary դարպասով կատարման ուղու համար։
  • Ամեն շաբաթ ստուգեք հերթի ժամանակը, վերասահմանման տոկոսը, միջադեպերի տոկոսը և կեղծ էսկալացիաները։
  • Փաստաթղթավորեք կանգառի անջատիչը և միջադեպի ժամանակ դարպասները խստացնելու գործընթացը։
  • Ավտոհաստատում միացրեք գործողությունների դասի համար միայն այն ժամանակ, երբ չափված ռիսկը համաձայնեցված շեմի ներսում է. dual-control կամ sampling հասունության համար փաստաթղթավորեք փուլը և ելքի չափանիշները՝ նախքան բազային դարպասը թուլացնելը։

Ինչպես է Northstar-ն օգտագործում HITL-ը

Northstar-ն նախ քարտեզագրում է աշխատահոսքը և դրա բացառությունները, հետո տեղադրում դարպասները։ Մենք առօրյա, շրջելի քայլերը շարունակում ենք շարժման մեջ պահել և մարդու վերահսկումը դնում այն կետում, որտեղ բիզնեսն արդեն պատասխանատու է էական որոշման համար։ Տեսեք լուծումները production-path աուդիտի և ներդրման մոդելի համար։

FAQ

  • Ոչ։ Հաստատեք արտաքին կամ անշրջելի գործողությունները, ոչ թե ամեն ներքին սևագիրը։ Եթե գեներացված հաղորդագրությունը չի կարող դուրս գալ sandbox-ից, ստուգումը կարող է հետո լինել ընտրանքով և evals-ով։