Κοιτάξτε οποιοδήποτε παραγωγικό σύστημα καλεί γλωσσικό μοντέλο και βρείτε το prompt. Θα βρίσκεται σε ένα αλφαριθμητικό, ή σε ένα αρχείο κειμένου που κανείς δεν άνοιξε εδώ και τρεις μήνες. Δεν έχει δοκιμές. Κανείς δεν μπορεί να σας πει αν η αλλαγή της περασμένης Τρίτης βελτίωσε κάτι, επειδή τίποτα δεν μετρήθηκε πριν ή μετά. Άλλαξε επειδή κάποιος εκνευρίστηκε με μια έξοδο ένα Πέμπτη απόγευμα. Είναι το μόνο συστατικό της στοίβας στο οποίο θα το ανεχόμασταν αυτό, και το ανεχόμαστε επειδή τα prompts μοιάζουν με πεζό λόγο και όχι με κώδικα.
Τι σημαίνει πραγματικά «προγραμματίζω αντί να προτρέπω»
Υπάρχει μια οικογένεια εργαλείων, με γνωστότερο το DSPy από την ομάδα NLP του Stanford, χτισμένη σε μια απλή αντιστροφή. Δεν γράφετε εσείς το prompt. Δηλώνετε τι μπαίνει και τι βγαίνει, δίνετε ένα μέτρο και ένα σύνολο παραδειγμάτων, και ένας βελτιστοποιητής αναζητά το κείμενο των οδηγιών και τις επιδείξεις που μεγιστοποιούν το μέτρο.
Το prompt παύει να είναι αυτό που συντάσσετε και γίνεται αυτό που παράγει το σύστημα. Είναι πιο κοντά σε έξοδο μεταγλωττιστή παρά σε έγγραφο: εσείς συντηρείτε την προδιαγραφή και τις δοκιμές, και το τεχνούργημα παράγεται. Αν αυτό ακούγεται σαν μικρή μετατόπιση έμφασης, σκεφτείτε τι σας υποχρεώνει να έχετε. Δεν βελτιστοποιείτε χωρίς μέτρο. Δεν έχετε μέτρο χωρίς να αποφασίσετε τι σημαίνει καλό. Δεν αξιολογείτε χωρίς σύνολο δεδομένων. Οι περισσότερες ομάδες δεν έχουν κανένα από τα τρία, και ακριβώς γι' αυτό τα prompts τους είναι αμέτρητα.
Οι τρεις προϋποθέσεις, ειλικρινά διατυπωμένες
Δεν είναι γρήγορο κέρδος, και τα έργα που είδαμε να αποτυγχάνουν το έκαναν πηδώντας κατευθείαν στην εγκατάσταση.
Ένα μέτρο που συσχετίζεται με αυτό που σας νοιάζει. Για εξαγωγή και ταξινόμηση είναι εύκολο: ακριβής αντιστοίχιση, ακρίβεια ανά πεδίο, ένα F-score. Για παραγωγή κειμένου είναι δύσκολο, και ένα κακό μέτρο είναι χειρότερο από κανένα, επειδή ένας βελτιστοποιητής θα μεγιστοποιήσει ακριβώς ό,τι ζητήσατε. Αν το μέτρο σας ανταμείβει το μήκος, θα πάρετε μήκος. Είναι η ίδια αστοχία που περιγράψαμε στην ασφάλεια των agents ως reward hacking, μόνο που εδώ φτάνει προσκεκλημένη αντί για τυχαία.
Ένα σύνολο αξιολόγησης. Στην πράξη πενήντα έως διακόσια επισημασμένα παραδείγματα, χωρισμένα ώστε να κρατάτε κάποια στην άκρη. Η κατασκευή του είναι μια μέρα άχαρης δουλειάς με κάποιον που ξέρει το αντικείμενο, και είναι η πολυτιμότερη μέρα ολόκληρης της άσκησης, επειδή το σύνολο αξιολόγησης επιβιώνει του πλαισίου, του μοντέλου και πιθανότατα του έργου.
Μια εργασία που επαναλαμβάνεται. Η βελτιστοποίηση αξίζει εκεί όπου το ίδιο σχήμα δουλειάς τρέχει εκατοντάδες ή χιλιάδες φορές. Για ένα prompt που θα χρησιμοποιήσετε δύο φορές, το χειρόγραφο είναι το σωστό και όλα όσα λέει αυτό το άρθρο είναι επιβάρυνση.
Πού αποδίδει
Το μοτίβο είναι σταθερό: δομημένο, επαναλαμβανόμενο, μετρήσιμο. Εξαγωγή από έγγραφα σε πεδία. Ταξινόμηση και δρομολόγηση, όπου ένα δελτίο υποστήριξης ή ένα μήνυμα μπαίνει σε μία από γνωστές κατηγορίες. Κανονικοποίηση ακατάστατης εισόδου σε ένα σχήμα. Οτιδήποτε παράγει εγγραφή αντί για παράγραφο.
Αποδίδει άσχημα στη σύνταξη μιας φοράς, στη γραφή ανοιχτού τύπου, και σε εργασίες όπου ο ορισμός της επιτυχίας ζει στην κρίση ενός ανθρώπου και αλλάζει με τα συμφραζόμενα. Αν δεν μπορείτε να γράψετε τι είναι μια καλή έξοδος, ένας βελτιστοποιητής δεν μπορεί να τη βρει.
Υπάρχει και ένα πιο σιωπηλό όφελος που αξίζει να ονομαστεί. Μόλις το prompt παράγεται από προδιαγραφή, η αλλαγή του υποκείμενου μοντέλου παύει να είναι ξαναγράψιμο. Ξανατρέχετε τον βελτιστοποιητή απέναντι στο νέο μοντέλο και συγκρίνετε μέτρα. Οι ομάδες που ρυθμίζουν prompts στο χέρι χτίζουν, χωρίς να το επιδιώκουν, ένα κόστος μετάβασης μέσα στη δική τους στοίβα.
Το μέρος που πρέπει να κλέψετε ακόμη κι αν δεν εγκαταστήσετε τίποτα
Το μεγαλύτερο μέρος της αξίας δεν βρίσκεται στο πλαίσιο. Βρίσκεται σε τέσσερις συνήθειες, και μπορείτε να τις υιοθετήσετε όλες αυτόν τον μήνα χωρίς καμία νέα εξάρτηση.
- Βάλτε το prompt σε έλεγχο εκδόσεων ως δικό του αρχείο, όχι ενσωματωμένο στον κώδικα εφαρμογής, με ένα σχόλιο που λέει σε τι χρησιμεύει και ποιος το κατέχει.
- Γράψτε το μέτρο, έστω άτυπα: τι κάνει μια έξοδο σωστή, και ποια είναι η απαράδεκτη αστοχία. Μία παράγραφος.
- Φτιάξτε το σύνολο αξιολόγησης. Τριάντα πραγματικές είσοδοι με γνωστές σωστές εξόδους νικούν ένα τέλειο πλαίσιο χωρίς καμία.
- Τρέξτε το πριν και μετά από κάθε αλλαγή. Αυτό μετατρέπει τη σύνταξη prompt από γνώμη σε πείραμα, και είναι όλο το παιχνίδι.
Μια ομάδα που κάνει αυτά τα τέσσερα έχει συλλάβει το μεγαλύτερο μέρος του οφέλους. Μια ομάδα που εγκαθιστά το πλαίσιο χωρίς αυτά έχει αποκτήσει μια εξάρτηση και μια ψευδή αίσθηση αυστηρότητας.
Η διάσταση της κυριαρχίας
Επειδή τα πλαίσια αυτά είναι ανεξάρτητα από τον πάροχο, η βελτιστοποίηση μπορεί να τρέξει απέναντι σε μοντέλο στο δικό σας υλικό μέσω τοπικού διακομιστή αντί για εμπορικό σημείο απόληξης. Αυτό μετράει για δύο λόγους.
Ο προφανής είναι η εμπιστευτικότητα: βελτιστοποίηση σημαίνει ότι στέλνετε το σύνολο αξιολόγησής σας, που είναι εξ ορισμού ένα αποσταγμένο δείγμα της πραγματικής σας δουλειάς, μέσα από το μοντέλο πολλές φορές. Το να γίνεται αυτό απέναντι σε σημείο απόληξης τρίτου είναι μεγαλύτερη αποκάλυψη από οποιοδήποτε μεμονωμένο prompt θα το σκεφτόσασταν δεύτερη φορά. Ο λιγότερο προφανής είναι η ιδιοκτησία. Αυτό που παίρνετε στο τέλος είναι ένα τεχνούργημα κειμένου και ένα σύνολο επιδείξεων που ζουν στο αποθετήριό σας. Είναι κάτι που σας ανήκει, που συγκρίνεται, ελέγχεται και μεταφέρεται σε άλλο μοντέλο. Είναι το αντίθετο της διευθέτησης όπου η συσσωρευμένη τέχνη σας στα prompts είναι σκορπισμένη στην κονσόλα ενός προμηθευτή.
Τι χρειάζεται για την τοπική πλευρά αυτού το εκθέσαμε στο Ο ιδιωτικός βοηθός ΤΝ.
Τρεις παγίδες
Υπερπροσαρμογή. Ένας βελτιστοποιητής με μικρό σύνολο αξιολόγησης θα βρει το prompt που νικά σε εκείνα τα παραδείγματα. Κρατήστε ένα σύνολο δοκιμής που δεν βελτιστοποιείτε ποτέ, και θεωρήστε τη διαφορά των δύο βαθμολογιών ως μέτρο της ειλικρίνειάς σας.
Αδιαφάνεια. Τα βελτιστοποιημένα prompts είναι συχνά παράξενα: περιέργως διατυπωμένες οδηγίες, παραδείγματα επιλεγμένα για λόγους που κανείς δεν μπορεί να αρθρώσει. Καταλήγετε με ένα καλύτερο prompt που καταλαβαίνετε λιγότερο καλά από εκείνο που γράψατε. Αυτό είναι πραγματικό κόστος όταν κάτι πάει στραβά στις τρεις τα ξημερώματα, και είναι επιχείρημα για να κρατάτε την προδιαγραφή και το μέτρο ευανάγνωστα ακόμη κι όταν η έξοδος δεν είναι.
Λύνετε το λάθος μισό. Αν το μοντέλο αστοχεί επειδή η ανάκτησή σας επιστρέφει λάθος έγγραφα, καμία ποσότητα βελτιστοποίησης prompt δεν θα το διορθώσει. Μετρήστε πρώτα, και βρείτε ποιο συστατικό σας χάνει πραγματικά βαθμούς, πριν βελτιστοποιήσετε εκείνο που βελτιστοποιείται ευκολότερα.
Από πού ξεκινάτε
Διαλέξτε το ένα prompt του οργανισμού σας που τρέχει συχνότερα και σπάει πιο ντροπιαστικά. Αφιερώστε μία μέρα φτιάχνοντας εκατό παραδείγματα με γνωστές σωστές απαντήσεις και γράφοντας το μέτρο. Μετρήστε το τρέχον prompt απέναντί του, και γράψτε τον αριθμό στον τοίχο.
Εκείνος ο αριθμός είναι το ζητούμενο. Το αν μετά θα πιάσετε ένα πλαίσιο ή θα συνεχίσετε να γράφετε στο χέρι μετράει πολύ λιγότερο από το γεγονός ότι μπορείτε πλέον να δείτε τη διαφορά. Το prompt έγινε κώδικας, όχι λόγω των εργαλείων, αλλά επειδή επιτέλους έχει δοκιμή.
Το άρθρο προέκυψε από σημείωμα Focus για το DSPy τον Σεπτέμβριο του 2026. Σχετική ανάγνωση: Το κόστος επαλήθευσης για το γιατί ένα σύνολο αξιολόγησης κάνει φθηνό τον έλεγχο, και Ο ιδιωτικός βοηθός ΤΝ.