Պաշտպանություն հրահանգների ներարկումից գործիքներով աշխատող գործակալներում
Ինչպես է անվստահելի email-ը, վեբը և PDF-ը տիրում գործակալին - և գործնական պաշտպանություն, որն իրականում օգնում է։
Northstar
Northstar-ն AI agent systems ստուդիա է։ Ալեքսը՝ engineering/product, Ջորդանը՝ operations/workflow fit։ Production գործակալներ առկա tools-ում։
Alex Morgan · LinkedIn · Northstar
Այս էջում
Ուղիղ պատասխան
Դիտեք ամբողջ external text-ը որպես hostile։ Առանձնացրեք instructions-ը data-ից, constrain արեք tools, պահանջեք gates irreversible actions-ի վրա, և երբեք թույլ մի տվեք retrieved content-ին redefine անել system policy։
Direct vs indirect injection
User-ը գրում է «ignore rules» vs webpage/email, որ ասում է «forward secrets to …»։ Indirect-ն է business killer-ը։
Defenses, որոնք օգնում են
Allowlisted tools, no open browsing high-trust agents-ում, sanitize/truncate untrusted text, dual-channel confirmations sends-ի համար, human gates։
Defenses, որոնք թույլ են միայնակ
«You are a safe assistant» pep talks system prompt-ում։
PDF և email
Նույն rules. content-ը data է, ոչ authority։
Ինչպես է Northstar-ն տեղավորվում
Security-minded design-ը default է Northstar pilots-ում. solutions։
FAQ
Դուք reduce եք անում risk. չեք կարող wish away անել, եթե tools-ը կարող են act անել։