Υπάρχει μια στιγμή σχεδόν σε κάθε έργο συμμόρφωσης όπου η συζήτηση παύει να αφορά χαρτιά. Κάποιος στο τραπέζι λέει: εντάξει, αλλά αυτά δεν μπορούμε να τα βάλουμε σε chatbot, άρα υπάρχει εκδοχή που μένει μέσα στο κτίριο; Η ειλικρινής απάντηση, το 2026, είναι ναι. Κοστίζει λιγότερο από όσο υποθέτουν, δουλεύει καλύτερα από όσο υποθέτουν οι δύσπιστοι, και το δύσκολο κομμάτι δεν είναι κανένα από όσα τους ανησυχούν.
Για τι πράγμα μιλάμε πραγματικά
Ένας ιδιωτικός βοηθός είναι ένα μοντέλο ανοιχτών βαρών που τρέχει σε υλικό που ελέγχετε, τυλιγμένο σε μια διεπαφή που χρησιμοποιούν οι άνθρωποί σας, με πρόσβαση στα έγγραφά σας. Τίποτα δεν φεύγει. Δεν υπάρχει λογαριασμός ανά token, δεν υπάρχουν όροι χρήσης προμηθευτή που διέπουν τα prompts σας, δεν υπάρχει διεθνής διαβίβαση προς αιτιολόγηση, και δεν υπάρχει τρίτος στην αλυσίδα για να προστεθεί σε μητρώο προμηθευτών.
Δεν είναι μοντέλο αιχμής. Δεν θα φτάσει το καλύτερο εμπορικό σύστημα στις δυσκολότερες εργασίες συλλογισμού, και όποιος σας λέει το αντίθετο σας πουλάει κάτι. Το σωστό πλαίσιο είναι εκείνο στο οποίο επιστρέφουμε συνεχώς: η περυσινή αιχμή, που σας ανήκει και τρέχει με μηδενικό κόστος ανά token. Για μια διαρκώς μεγαλύτερη λίστα εργασιών, η ανταλλαγή αξίζει πλέον προφανώς.
Ο ένας αριθμός που κρίνει τα πάντα
Σχεδόν κάθε λάθος που βλέπουμε σε τοπικές εγκαταστάσεις προέρχεται από την επιλογή του μοντέλου με βάση το μέγεθός του. Το μέγεθος που μετράει σε μέτριο υλικό είναι πόσες παράμετροι ενεργοποιούνται ανά token.
Ο λόγος είναι ο εξής. Σε μηχάνημα με κοινόχρηστη ή ενσωματωμένη μνήμη, η ταχύτητα παραγωγής περιορίζεται από το εύρος ζώνης μνήμης και όχι από την υπολογιστική ισχύ: κάθε token που παράγεται ρέει τα ενεργά βάρη μπροστά από το τσιπ. Ένα πυκνό μοντέλο ενεργοποιεί όλες τις παραμέτρους του για κάθε token. Ένα μοντέλο μείγματος ειδικών ενεργοποιεί ένα μικρό κλάσμα. Η συνέπεια είναι αντιδιαισθητική και σταθερή.
Σε μια μέτρηση πάνω σε μικρό mini PC με ενοποιημένη μνήμη, την οποία καλύψαμε στα Focus σημειώματά μας, ένα μοντέλο μείγματος ειδικών 35 δισεκατομμυρίων παραμέτρων έφτασε περίπου τα 38 tokens ανά δευτερόλεπτο, ενώ ένα μικρότερο πυκνό μοντέλο 12 δισεκατομμυρίων παραμέτρων έμεινε περίπου στα 10. Το αραιό αλλά μεγάλο νίκησε το μικρό αλλά πυκνό σχεδόν τέσσερις προς ένα στο ίδιο μηχάνημα. Πρόκειται για αριθμούς μίας εκτέλεσης, σε μία κβαντοποίηση, με προεπιλεγμένες ρυθμίσεις, οπότε θεωρήστε τους κατεύθυνση και όχι προδιαγραφή, και μετρήστε το δικό σας μοντέλο στη δική σας εργασία. Η κατεύθυνση όμως έχει κρατήσει κάθε φορά που την ελέγξαμε.
Δύο πορίσματα προκύπτουν. Ολόκληρο το μοντέλο πρέπει να χωράει στη μνήμη ακόμη κι αν μόνο μέρος του είναι ενεργό ανά token, οπότε το συνολικό μέγεθος ορίζει τι μπορείτε να φορτώσετε και το ενεργό μέγεθος ορίζει πόσο γρήγορα τρέχει. Και αν έχετε διακριτή κάρτα, ο κανόνας αντιστρέφεται προς τα πυκνά μοντέλα: αγοράστε VRAM, όχι εύρος ζώνης.
Τρεις βαθμίδες που υπάρχουν στ' αλήθεια
Ένα mini PC με ενοποιημένη μνήμη, για μικρή ομάδα. Ορίστε την εκχώρηση μνήμης βίντεο στο BIOS, εξυπηρετήστε με Ollama, και έχετε μηχάνημα που τρέχει ένα ικανό μοντέλο μείγματος ειδικών σε αναγνώσιμη ταχύτητα για λίγους ταυτόχρονους χρήστες. Αυτή είναι η βαθμίδα που εκπλήσσει. Είναι επίσης η βαθμίδα όπου η φράση «συνηθισμένος υπολογιστής» τεντώνεται: πρόκειται για μικρό μηχάνημα αγορασμένο σκόπιμα με τα τοπικά μοντέλα στο μυαλό, όχι για το laptop που ήδη έχει κάποιος.
Ένας σταθμός εργασίας με κάρτα 24GB, για ένα τμήμα. Ένα πυκνό μοντέλο 27 δισεκατομμυρίων παραμέτρων με κεφαλή όρασης κβαντίζεται περίπου στα 13GB και κάθεται άνετα σε 24GB με χώρο για συμφραζόμενα. Η όραση μετράει περισσότερο απ' όσο ακούγεται: ένα μοντέλο που διαβάζει ένα στιγμιότυπο οθόνης, ένα σαρωμένο τιμολόγιο ή ένα διάγραμμα καλύπτει εκπληκτικά μεγάλο μέρος των πραγματικών αιτημάτων ενός γραφείου. Δύο δωρεάν βελτιώσεις περίπου διπλασιάζουν τη ρυθμαπόδοση σε στενεμένες διατάξεις: μια σφιχτότερη κβαντοποίηση που πράγματι χωράει στη VRAM, και η κερδοσκοπική αποκωδικοποίηση.
Ένας διακομιστής με δύο κάρτες, για μια εταιρεία. Σε αυτό το σημείο τρέχετε υπηρεσία, με ουρές, ταυτοχρονισμό και προσδοκίες διαθεσιμότητας, και οφείλετε να εξυπηρετείτε με vLLM αντί για εργαλείο επιφάνειας εργασίας. Επίσης τρέχετε, είτε το παραδέχεστε είτε όχι, ένα μικρό κομμάτι παραγωγικής υποδομής, με ό,τι αυτό συνεπάγεται για αντίγραφα ασφαλείας, παρακολούθηση και κάποιον σε ετοιμότητα.
Μία παγίδα αξίζει να ονομαστεί: αν το μοντέλο δεν χωράει, μην εκφορτώνετε τυφλά όλα τα επίπεδα στη GPU. Το κάνει δραματικά πιο αργό, όχι πιο γρήγορο. Και μια εξωτερική GPU μέσω USB4 ή Thunderbolt είναι απολύτως επαρκής για συμπερασμό, επειδή μόλις τα βάρη εγκατασταθούν η σύνδεση σχεδόν δεν χρησιμοποιείται.
Η υπόλοιπη στοίβα
Το μοντέλο είναι το κομμάτι για το οποίο μιλούν όλοι και το μικρότερο κομμάτι της δουλειάς.
- Εξυπηρέτηση. Ollama για μια ομάδα, vLLM όταν χρειάζεστε ρυθμαπόδοση και ταυτοχρονισμό. Και τα δύο τρέχουν εξ ολοκλήρου στο υλικό σας και εκθέτουν διεπαφή συμβατή με OpenAI, που σημαίνει ότι τα περισσότερα εργαλεία γραμμένα για εμπορικά API δείχνουν στο μηχάνημά σας με αλλαγή της βασικής διεύθυνσης.
- Το επίπεδο εφαρμογής. Μια αυτοφιλοξενούμενη πλατφόρμα για να χτίζονται οι πραγματικοί βοηθοί, ώστε όσοι καταλαβαίνουν τη δουλειά να συναρμολογούν μια ροή χωρίς να περιμένουν προγραμματιστή. Εδώ κερδίζεται ή χάνεται η υιοθέτηση.
- Ανάκτηση πάνω στα έγγραφά σας. Η αξία σπάνια είναι η γενική γνώση του μοντέλου. Είναι ότι μπορεί να απαντήσει από τις συμβάσεις σας, τις διαδικασίες σας και την αλληλογραφία της τελευταίας τριετίας.
- Απόκρυψη στο σύνορο. Ακόμη και σε τοπική εγκατάσταση, καλύψτε τα προσωπικά δεδομένα πριν μπουν σε ευρετήρια και αρχεία καταγραφής. Τα εργαλεία απόκρυψης στη συσκευή καλύπτουν πλέον αξιοπρεπώς τα ελληνικά, αν και η κάλυψη διαφέρει ανά τύπο πεδίου και πρέπει να δοκιμαστεί στις δικές σας μορφές.
Το μέρισμα συμμόρφωσης
Αυτό είναι το μέρος που δικαιολογεί το έργο σε ένα διοικητικό συμβούλιο, και δεν είναι λόγια του αέρα.
Με τοπικό βοηθό δεν υπάρχει εκτελών την επεξεργασία για να προστεθεί στην απογραφή προμηθευτών της NIS2 ούτε σύμβαση προμηθευτή για επαναδιαπραγμάτευση ως προς την ενημέρωση περιστατικών. Δεν υπάρχει διεθνής διαβίβαση προς εκτίμηση ούτε κατάλογος υπεργολάβων προς παρακολούθηση κατά τον GDPR. Στον Κανονισμό ΤΝ παραμένετε φορέας εφαρμογής με υποχρεώσεις γραμματισμού και διαφάνειας, όμως τα ερωτήματα για το πού πηγαίνουν τα prompts, που το omnibus δεν άγγιξε, απαντούν μόνα τους. Και ο συχνότερος τρόπος αστοχίας του shadow AI, να επικολλά το προσωπικό υλικό πελατών σε δωρεάν καταναλωτικό εργαλείο επειδή το εγκεκριμένο είναι αδύνατο να χρησιμοποιηθεί, χάνει το κίνητρό του όταν το εγκεκριμένο είναι γρήγορο, αμέτρητο και δεν αρνείται.
Τα τέσσερα κόστη που δεν μπαίνουν στην πρόταση
Δεν υπάρχει κανείς να τηλεφωνήσετε. Όταν ένα εμπορικό API υποβαθμίζεται, ανοίγετε δελτίο. Όταν υποβαθμίζεται το μηχάνημά σας, το δελτίο είστε εσείς. Για πολλούς οργανισμούς αυτή η μία πρόταση είναι ο σωστός λόγος να μην το κάνουν.
Η αξιολόγηση γίνεται δική σας δουλειά. Κανείς δεν βελτιώνει σιωπηλά το μοντέλο πίσω από την πλάτη σας, που είναι ταυτόχρονα το ζητούμενο και το πρόβλημα. Χρειάζεστε ένα μικρό σύνολο πραγματικών εργασιών με γνωστές σωστές απαντήσεις, να τρέχει μετά από κάθε αλλαγή, αλλιώς θα ανακαλύψετε μια οπισθοδρόμηση μέσα από το κακό απόγευμα ενός συναδέλφου.
Η ανανέωση του μοντέλου γίνεται απόφαση. Τα ανοιχτά βάρη κινούνται γρήγορα. Κάποιος πρέπει να προσέξει ότι ένα καλύτερο μοντέλο χωράει πλέον στην ίδια μνήμη, να το δοκιμάσει και να αλλάξει. Αφημένη μόνη της, μια τοπική εγκατάσταση γερνά σιωπηλά σε χειρότερο προϊόν από την επιλογή cloud που αντικατέστησε.
Ένα κατονομασμένο πρόσωπο πρέπει να το κατέχει. Υλικό, ενημερώσεις, το σύνολο αξιολόγησης, το ευρετήριο των εγγράφων, οι κανόνες πρόσβασης. Μισή μέρα τον μήνα όταν είναι υγιές, μια κακή εβδομάδα όταν δεν είναι. Τα έργα που παρακάμπτουν αυτό το βήμα δεν αποτυγχάνουν θορυβωδώς· απλώς παύουν να χρησιμοποιούνται.
Τι θα προτείναμε πραγματικά
Υβριδικό, σχεδόν πάντα. Βάλτε στο δικό σας υλικό τη δουλειά που είναι ευαίσθητη, επαναλαμβανόμενη και καλά ορισμένη: σύνοψη εσωτερικών εγγράφων, σύνταξη από υποδείγματα, αναζήτηση στο δικό σας σώμα κειμένων, ταξινόμηση, απομαγνητοφώνηση, μετάφραση πρώτου περάσματος. Κρατήστε τη συνδρομή αιχμής για τον δύσκολο, περιστασιακό, μη ευαίσθητο συλλογισμό που τη δικαιολογεί. Δρομολογήστε σκόπιμα και όχι από συνήθεια.
Ξεκινήστε με μία εργασία, ένα μηχάνημα, έναν υπεύθυνο και μια γραπτή μέτρηση του αν πέτυχε. Αν ο βοηθός είναι γρηγορότερος από την εναλλακτική και οι απαντήσεις αντέχουν, η δεύτερη εργασία θα έρθει μόνη της. Αν δεν είναι, θα έχετε ξοδέψει έναν μεσαίο σταθμό εργασίας για να το μάθετε, που είναι φθηνή απάντηση σε ακριβό ερώτημα.
Οι παρατηρήσεις για τις ενεργές παραμέτρους, το εύρος ζώνης μνήμης και την κβαντοποίηση προέρχονται από πρακτικές μετρήσεις που συνοψίσαμε στα σημειώματα Focus τον Σεπτέμβριο του 2026· τα νούμερα είναι εξ ορισμού μίας εκτέλεσης και εξαρτώνται από το υλικό. Σχετική ανάγνωση: Shadow AI και Πριν Υιοθετήσετε ΤΝ.