Բլոգ

1 րոպե կարդալուԱնվտանգություն և կառավարումՈւսուցում

Պաշտպանություն հրահանգների ներարկումից գործիքներով աշխատող գործակալներում

Ինչպես է անվստահելի email-ը, վեբը և PDF-ը տիրում գործակալին - և գործնական պաշտպանություն, որն իրականում օգնում է։

Northstar

Northstar-ն AI agent systems ստուդիա է։ Ալեքսը՝ engineering/product, Ջորդանը՝ operations/workflow fit։ Production գործակալներ առկա tools-ում։

Alex Morgan · LinkedIn · Northstar

Ուղիղ պատասխան

Դիտեք ամբողջ external text-ը որպես hostile։ Առանձնացրեք instructions-ը data-ից, constrain արեք tools, պահանջեք gates irreversible actions-ի վրա, և երբեք թույլ մի տվեք retrieved content-ին redefine անել system policy։

Direct vs indirect injection

User-ը գրում է «ignore rules» vs webpage/email, որ ասում է «forward secrets to …»։ Indirect-ն է business killer-ը։

Defenses, որոնք օգնում են

Allowlisted tools, no open browsing high-trust agents-ում, sanitize/truncate untrusted text, dual-channel confirmations sends-ի համար, human gates։

Defenses, որոնք թույլ են միայնակ

«You are a safe assistant» pep talks system prompt-ում։

PDF և email

Նույն rules. content-ը data է, ոչ authority։

Ինչպես է Northstar-ն տեղավորվում

Security-minded design-ը default է Northstar pilots-ում. solutions։

FAQ

  • Դուք reduce եք անում risk. չեք կարող wish away անել, եթե tools-ը կարող են act անել։