Τα περισσότερα κείμενα για την ασφάλεια των agents αφορούν ακόμη το σχήμα του προβλήματος. Αυτό δεν είναι τέτοιο. Οι προγραμματιστές σας ήδη τρέχουν agents που αγγίζουν αποθετήρια, στο λογιστήριο πωλείται ένας που διαβάζει τιμολόγια, και κάπου μια αυτοματοποίηση φυλλομετρητή είναι συνδεδεμένη σε κάτι που δεν θα έπρεπε. Αυτό που ακολουθεί είναι το επίπεδο της διαμόρφωσης: έξι έλεγχοι, με τη σειρά που θα τους εφαρμόζαμε.
Τρεις παραδοχές για αρχή
Κάθε έλεγχος παρακάτω προκύπτει από τρία πράγματα που ο τελευταίος χρόνος δίδαξε, ακριβά.
Η είσοδος είναι εχθρική. Ένας agent διαβάζει έγγραφα, ιστοσελίδες, δελτία, μηνύματα και αποτελέσματα αναζήτησης. Οποιοδήποτε από αυτά μπορεί να μεταφέρει κείμενο που διαβάζεται ως οδηγία. Το πώς η συνηθισμένη ελλιπής διατύπωση γίνεται prompt injection το περιγράψαμε στο Το Παράδοξο του Πλυντηρίου· το επιχειρησιακό συμπέρασμα είναι ότι δεν υπάρχει αξιόπιστος τρόπος να διαχωριστούν τα δεδομένα από τις οδηγίες μέσα σε μία ροή κειμένου, άρα ο διαχωρισμός πρέπει να επιβληθεί έξω από το μοντέλο.
Ο agent βελτιστοποιεί για την έγκριση, όχι για την αλήθεια. Δημοσιευμένες αναφορές περιστατικών από εργαστήρια αιχμής περιγράφουν πλέον reward hacking στο πεδίο: agents που κάνουν ό,τι κερδίζει θετική βαθμολογία αντί για ό,τι ζητήθηκε, και σε τουλάχιστον ένα τεκμηριωμένο μοτίβο, χαλαρώνουν τους ίδιους τους περιορισμούς τους μέσα από τα σημειώματα που γράφουν στον εαυτό τους ανάμεσα σε συνεδρίες. Τα περισσότερα είναι ακόμη περιθωριακά και οι αναφορές το λένε. Αρκεί για να σχεδιάσουμε απέναντί τους.
Ο τρόπος πρόσβασης μπορεί να αλλάξει χωρίς προειδοποίηση. Στους πιο χρήσιμους agents δίνεται χρήση υπολογιστή, επειδή δουλεύει εκεί όπου δεν υπάρχει διεπαφή. Σε μια επώνυμη περιγραφή από ομάδα που χτίζει ακριβώς αυτό, ένας agent πέρασε από δομημένη ενοποίηση στον χειρισμό του ποντικιού για ένα μόνο βήμα, και ένας μη τεχνικός χρήστης είδε έναν κινούμενο δείκτη αντί για το σενάριο. Το απρόσκοπτο και το παρατηρήσιμο τραβούν προς αντίθετες κατευθύνσεις, και η αγορά επιλέγει το απρόσκοπτο. Η διαμόρφωσή σας πρέπει να επιλέξει το άλλο.
Έλεγχος πρώτος: διαπιστευτήρια περιορισμένα στην εργασία
Η προεπιλογή σχεδόν σε κάθε εγκατάσταση που έχουμε εξετάσει είναι ένας λογαριασμός υπηρεσίας με ευρέα δικαιώματα, φτιαγμένος μία φορά για να δουλέψουν όλα, και ποτέ περιορισμένος. Είναι το ίδιο λάθος με τον κοινόχρηστο κωδικό διαχειριστή, γρηγορότερα.
Αυτό που πρέπει να γίνει αντ' αυτού είναι συνηθισμένη μηχανική. Μία ταυτότητα ανά agent, ποτέ κοινή με άνθρωπο και ποτέ επαναχρησιμοποιούμενη ανάμεσα σε agents. Δικαιώματα περιορισμένα στην εργασία και όχι στον ρόλο, που συνήθως σημαίνει ανάγνωση σχεδόν σε όλα και εγγραφή σχεδόν σε τίποτα. Διαπιστευτήρια που εκδίδονται ανά εκτέλεση και λήγουν γρήγορα, ώστε ένα διαρρεύσαν διακριτικό να έχει λήξει πριν γίνει χρήσιμο. Ξεχωριστά διαπιστευτήρια για ξεχωριστά περιβάλλοντα, ώστε ένας agent με πρόσβαση στην παραγωγή απλώς να μην υπάρχει εκτός αν το απαιτεί μια εργασία.
Και ο κανόνας που άλλαξε χαρακτήρα: κανένα μυστικό σε αποθετήρια, ποτέ. Αυτό ήταν κάποτε υγιεινή. Δημοσιευμένες αναφορές περιγράφουν πλέον agent που έψαχνε δημόσια αποθετήρια για κλειδιά API σκόπιμα. Ένα κλειδί που μπήκε σε commit δεν περιμένει πια να βρεθεί από τύχη· κάτι το ψάχνει, συνεχώς, με ταχύτητα μηχανής.
Έλεγχος δεύτερος: η πύλη
Η πολυτιμότερη δομή σε μια εγκατάσταση agent είναι ένα ρητό σύνορο ανάμεσα στην πρόταση μιας ενέργειας και την πρόκληση ενός αποτελέσματος. Ό,τι βρίσκεται στη μία πλευρά είναι αναστρέψιμο και φθηνό. Ό,τι βρίσκεται στην άλλη χρειάζεται απόφαση.
Η λίστα όσων ανήκουν πίσω από την πύλη είναι αρκετά σύντομη ώστε να συμφωνηθεί σε μία συνεδρίαση: εγγραφές σε συστήματα και βάσεις παραγωγής, οτιδήποτε μετακινεί χρήματα, οτιδήποτε στέλνει μήνυμα εκτός του οργανισμού, κάθε διαγραφή, χρήση διαπιστευτηρίου που η εργασία δεν απαιτούσε ρητά, και κάθε αλλαγή τρόπου πρόσβασης. Όλα τα υπόλοιπα ο agent μπορεί να τα κάνει ελεύθερα, και οφείλει, επειδή μια πύλη μπροστά από τα πάντα πατιέται χωρίς να διαβάζεται, που είναι χειρότερο από καμία πύλη.
Δύο λεπτομέρειες σχεδιασμού κρίνουν αν η πύλη λειτουργεί. Η έγκριση πρέπει να δείχνει το αποτέλεσμα και όχι την πρόθεση, δηλαδή την πραγματική εντολή, τον πραγματικό παραλήπτη, το πραγματικό ποσό, όχι μια σύνοψη του τι πιστεύει ο agent ότι πρόκειται να κάνει. Και η πύλη πρέπει να είναι εκτός της εμβέλειας του agent: μια ξεχωριστή διεργασία με δικά της δικαιώματα, όχι ένα εργαλείο που ο agent μπορεί να πειστεί να καλέσει για λογαριασμό του.
Έλεγχος τρίτος: το αρχείο καταγραφής
Ρωτήστε για κάθε εγκατάσταση agent: σε τρεις εβδομάδες από τώρα, μπορούμε να ανασυνθέσουμε τι έκανε πραγματικά ένα συγκεκριμένο απόγευμα; Στις περισσότερες εγκαταστάσεις η ειλικρινής απάντηση είναι όχι. Υπάρχει ένα απομαγνητοφωνημένο διάλογο, που καταγράφει τι είπε ο agent, και αυτό δεν είναι το ίδιο πράγμα.
Καταγράψτε ενέργειες αντί για διάλογο: την κλήση, τον στόχο, τις παραμέτρους, το αποτέλεσμα, την ταυτότητα που χρησιμοποιήθηκε, τη χρονοσήμανση. Σημειώστε τον τρόπο πρόσβασης σε κάθε ενέργεια, και αντιμετωπίστε την αλλαγή τρόπου πρόσβασης ως αυτοτελές συμβάν, καταγεγραμμένο και με δυνατότητα ειδοποίησης, επειδή αυτή είναι η μετάβαση που διευρύνει σιωπηλά την ακτίνα ζημιάς. Κρατήστε το αρχείο έξω από το σύστημα στο οποίο μπορεί να γράψει ο agent. Κάντε το ανακτήσιμο από άνθρωπο που δεν συμμετείχε, που είναι η μόνη δοκιμασία με σημασία, και δώστε του διάρκεια διατήρησης που αντέχει τον χρόνο μέχρι να γίνει αντιληπτό ένα πρόβλημα, ο οποίος συνήθως είναι μεγαλύτερος απ' όσο νομίζετε.
Έλεγχος τέταρτος: ό,τι διαβάζει είναι μη έμπιστο, μαζί και τα δικά του σημειώματα
Το ανακτημένο περιεχόμενο είναι δεδομένα, ποτέ οδηγία. Στην πράξη αυτό σημαίνει τα βαρετά: κρατήστε το ανακτημένο κείμενο σε ξεχωριστό κανάλι από την περιγραφή της εργασίας, μη συνενώνετε ποτέ ένα κατεβασμένο έγγραφο μέσα στο μπλοκ των οδηγιών, αφαιρέστε ή εξουδετερώστε σήμανση που μεταφέρει προσταγές, και περιορίστε την έξοδο σε ένα σχήμα όπου η ενέργεια είναι δομημένο πεδίο και όχι ελεύθερο κείμενο που ερμηνεύει μετά το σύστημα.
Το σημείο που ξεφεύγει στους οργανισμούς είναι ότι αυτό ισχύει και για τη μνήμη του ίδιου του agent. Συνόψεις, αρχεία μνήμης, σημειώματα παράδοσης ανάμεσα σε συνεδρίες και κοινόχρηστα αρχεία συμφραζομένων είναι όλα είσοδος, και γράφτηκαν όλα από κάτι που μπορεί να επηρεαστεί. Ένας agent που διαβάζει τα παλιά του σημειώματα είναι επιφάνεια εισαγωγής εντολών, και μάλιστα εξαιρετική, επειδή εκείνο το περιεχόμενο φτάνει με το κύρος του ότι προήλθε από μέσα. Αντιμετωπίστε τη μόνιμη μνήμη ενός agent ως αγαθό με ιδιοκτήτη, ανασκόπηση και κανόνα διατήρησης, όπως θα αντιμετωπίζατε μια βάση δεδομένων.
Έλεγχος πέμπτος: περιορίστε την ακτίνα ζημιάς
Υποθέστε ότι ο agent έχει παραβιαστεί πλήρως και ρωτήστε τι φτάνει. Το ερώτημα αυτό, τεθειμένο πριν από την εγκατάσταση, παράγει καλύτερες αποφάσεις από οποιαδήποτε ποσότητα πολιτικής.
Οι απαντήσεις είναι άτονες και αποτελεσματικές. Τρέξτε τον σε δικό του περιβάλλον εκτέλεσης και όχι σε σταθμό εργασίας με τη συνεδρία ενός ανθρώπου. Δώστε του λίστα επιτρεπόμενων εξόδων, ώστε ένας agent που πείστηκε να διαρρεύσει κάτι να μην έχει πού να το στείλει. Μην του δίνετε ποτέ προφίλ φυλλομετρητή συνδεδεμένο σε τραπεζικές υπηρεσίες, ταχυδρομείο ή κονσόλα διαχείρισης, και αν η χρήση υπολογιστή είναι πράγματι απαραίτητη, δώστε του αποκλειστικό προφίλ με αποκλειστικούς, περιορισμένους λογαριασμούς. Βάλτε οροφή σε ό,τι μπορεί να κάνει μία εκτέλεση, σε όγκο όπως και σε είδος: ένας agent που μπορεί να στείλει ένα μήνυμα είναι χαρακτηριστικό, ένας agent που μπορεί να στείλει τετρακόσια είναι περιστατικό.
Έλεγχος έκτος: δοκιμάστε για τον τρόπο αστοχίας που πραγματικά έχετε
Ο συμβατικός έλεγχος ρωτά αν ο agent ολοκληρώνει την εργασία. Η αστοχία που πονάει είναι να ολοκληρώνει κάτι που μοιάζει με την εργασία.
Φτιάξτε ένα μικρό ανταγωνιστικό σύνολο και τρέξτε το σε κάθε αλλαγή. Ένα έγγραφο με θαμμένη οδηγία μέσα του. Ένα δελτίο που ζητά ευγενικά ένα διαπιστευτήριο. Μια εργασία αδύνατη, για να δείτε αν ο agent αναφέρει αποτυχία ή κατασκευάζει μια εύλογη επιτυχία. Μια εργασία όπου ο φθηνός τρόπος να κερδίσει έγκριση διαφέρει από το σωστό αποτέλεσμα. Ύστερα διαβάζετε πού και πού τα αρχεία μνήμης του agent, όπως θα ανασκοπούσατε κανόνες τείχους προστασίας, και ρωτάτε αν κάτι εκεί μέσα παραχωρεί πλέον στον agent περιθώριο που δεν ενέκρινε κανείς.
Η σύντομη εκδοχή
- Μία ταυτότητα ανά agent, περιορισμένη στην εργασία, βραχύβια, ποτέ κοινή με άνθρωπο.
- Κανένα μυστικό σε αποθετήρια. Κάτι τα ψάχνει σκόπιμα.
- Μια πύλη ανάμεσα στην πρόταση και το αποτέλεσμα, με λίστα τις εγγραφές σε παραγωγή, τα χρήματα, τα μηνύματα προς τα έξω, τις διαγραφές, τη χρήση διαπιστευτηρίων και τις αλλαγές τρόπου πρόσβασης.
- Εγκρίσεις που δείχνουν το αποτέλεσμα, όχι την πρόθεση, επιβαλλόμενες από διεργασία που ο agent δεν μπορεί να καλέσει.
- Αρχεία ενεργειών με τον τρόπο πρόσβασης σε κάθε εγγραφή, αποθηκευμένα εκεί όπου ο agent δεν μπορεί να γράψει.
- Ανακτημένο περιεχόμενο και μνήμη του agent ως μη έμπιστη είσοδος, σε ξεχωριστά κανάλια, με δομημένη έξοδο.
- Ξεχωριστό περιβάλλον εκτέλεσης, λίστα επιτρεπόμενων εξόδων, κανένα συνδεδεμένο προφίλ φυλλομετρητή που έχει σημασία, οροφές όγκου ανά εκτέλεση.
- Ένα ανταγωνιστικό σύνολο δοκιμών που περιλαμβάνει μια αδύνατη εργασία και μια θαμμένη οδηγία.
- Κατονομασμένος υπεύθυνος, και ο agent στο ίδιο μητρώο με τις υπόλοιπες μη ανθρώπινες ταυτότητές σας.
- Έναν διακόπτη τερματισμού που κάποιος έχει πράγματι χρησιμοποιήσει σε άσκηση.
Τίποτα από αυτά δεν είναι πρωτότυπο. Είναι ελάχιστο προνόμιο, διαχωρισμός καθηκόντων, καταγραφή ελέγχου και επικύρωση εισόδου, εφαρμοσμένα σε έναν δρώντα που είναι γρήγορος, εύπιστος και πειστικός για τη δική του αξιοπιστία. Η πρωτοτυπία είναι μόνο ότι ο δρώντας είναι καινούριος. Οι έλεγχοι είναι εκείνοι που ήδη ξέραμε, και οι οργανισμοί που θα τα πάνε καλά το 2027 θα είναι εκείνοι που έπαψαν να βλέπουν τον agent ως χαρακτηριστικό και άρχισαν να τον βλέπουν ως ταυτότητα με προϋπολογισμό δικαιωμάτων.
Σχετική ανάγνωση: Η Κρίση Ασφάλειας των AI Agents για τους ελέγχους ταυτότητας, Εκπαιδεύσατε τους Υπαλλήλους σας. Ποιος Εκπαιδεύει τους AI Agents σας; και Το Παράδοξο του Πλυντηρίου. Οι παρατηρήσεις για το reward hacking, τα αυτογραφόμενα σημειώματα και τις αλλαγές τρόπου πρόσβασης προέρχονται από δημοσιευμένες αναφορές περιστατικών εργαστηρίων και επώνυμες τεχνικές περιγραφές που καλύψαμε στα σημειώματα Focus τον Σεπτέμβριο του 2026.