Δικό σου — αφού το εκπαιδεύσεις
Πριν μια εβδομάδα γράψαμε ότι τα μοντέλα απόφασης, που δεν γράφουν ποτέ πρόταση και μόνο διαλέγουν από τις απαντήσεις που επιτρέπεις, έγιναν πρωτογενές συστατικό που μπορείς να κατέχεις. Μέρες μετά το επί πληρωμή Jev ήρθε ανοιχτή εναλλακτική: το Laya, Apache 2.0, 421 εκατομμύρια παράμετροι, βάρη στο χέρι. Αυτό ισχύει ακόμη. Εκείνο που δεν είπαμε είναι τι κοστίζει να το κατέχεις.
Υπέρ- Πραγματικά δικό σου: ανοιχτά βάρη, αυτοφιλοξενία, μηδέν κόστος ανά token, και 32,8 ms ανά ερώτηση σε μέτρια GPU έναντι 236 έως 276 ms που μέτρησαν τρίτοι πάνω από το επί πληρωμή API.
- Η κάρτα του μοντέλου είναι ασυνήθιστα ειλικρινής, και αυτή η ειλικρίνεια είναι ο λόγος που μπορούμε καν να γράψουμε αυτό το κείμενο.
- Εκτός κουτιού είναι κοντά στην τύχη. Στη δική του μέτρηση με 2.000 αποφάσεις, το βασικό αγγλικό checkpoint πιάνει 0,362, ενώ το να μαντεύεις πάντα την πιο συχνή απάντηση πιάνει 0,461. Με τα λόγια της κάρτας, «μια γρήγορη βάση για εξειδίκευση, όχι μηχανή αποφάσεων χωρίς εκπαίδευση».
- Μετά από fine-tuning φτάνει 0,766, αλλά η κάρτα σημειώνει ότι εκείνο το checkpoint εκπαιδεύτηκε στο ίδιο το training split της μέτρησης. Με 77 επιλογές πιάνει 0,425 έναντι 0,870 του επί πληρωμή. Και έρχεται υπερβολικά σίγουρο: στα Χμερ, γραφή που το αγγλικό checkpoint δεν διαβάζει, 0,000 ακρίβεια με 0,952 βεβαιότητα. «Το φιλτράρισμα με βάση τη βεβαιότητα δεν μπορεί να σε σώσει.»
Η γνώμη μαςΗ διόρθωση αφορά τη δική μας αισιοδοξία. Το πρωτογενές συστατικό μπορεί να γίνει δικό σου, και το τίμημα είναι ένα επισημασμένο σύνολο από τη δική σου δουλειά, ένα fine-tune, και επαναβαθμονόμηση πριν εμπιστευτείς έστω μία πιθανότητα. Το να κατέχεις τα βάρη είναι το φθηνό μέρος.
Πηγή: Κάρτα μοντέλου Laya (Convai Innovations, Hugging Face)
← Όλα τα Focus posts