Σίγουρος στο 0,91, σωστός όσο ένα κέρμα
Ομάδα του Carnegie Mellon έβαλε έναν φθηνό κριτή που δίνει μόνο αποφάσεις απέναντι σε δεκαέξι άλλους, μαζί με μοντέλα αιχμής. Κοστίζει 0,044 δολάρια ανά 1.000 κρίσεις και απαντά σε 0,15 δευτερόλεπτα, έναντι 12,182 δολαρίων και 1,89 δευτερολέπτων: 277 φορές φθηνότερος.
Υπέρ- Εκεί όπου η ετυμηγορία διαβάζεται από το ίδιο το κείμενο, πέφτει περίπου τρεις μονάδες από το μοντέλο αιχμής, και πάνω από 0,9 βεβαιότητα οι δύο είναι σχεδόν ισόπαλοι, 94,7 έναντι 94,4 τοις εκατό σε 3.744 στοιχεία.
- Ο καταρράκτης δουλεύει και είχε προδηλωθεί: δέξου όταν είσαι σίγουρος, κλιμάκωσε όταν δεν είσαι, 0,9 μονάδες ακριβέστερος από τον κριτή αιχμής με το 41 τοις εκατό της αμοιβής του.
- Σε πεζό κείμενο χωρίς σημείο αναφοράς είναι κοντά στην τύχη και σίγουρος για τον εαυτό του: 53,5 τοις εκατό συμφωνία με τις ετικέτες, με μέση μέγιστη πιθανότητα 0,91 και AUROC ανίχνευσης σφαλμάτων 0,498, δηλαδή κανένα σήμα. Δύο κριτές αιχμής έκαναν το ίδιο στα 0,94 και 0,96.
- Το ύφος τον ξεγελά. Όταν η χειρότερη απάντηση είναι η καλογραμμένη, υστερεί κατά 9 έως 23 μονάδες. Όρισε τα κατώφλια στα δικά σου δεδομένα με το κάτω όριο εμπιστοσύνης, όχι με τη σημειακή εκτίμηση.
Η γνώμη μαςΗ πρόταση που κρατάμε είναι του ίδιου του άρθρου: «Ένας φθηνός κριτής δεν χρειάζεται να έχει δίκιο παντού· χρειάζεται να ξέρει πού δεν έχει.» Σημειώστε επίσης ότι η εργασία δηλώνει δημόσια χρηματοδότηση και πιστώσεις API από προμηθευτή, και δοκίμασε μία έκδοση ενός προϊόντος. Η βεβαιότητα είναι αριθμός που αναφέρει το μοντέλο, όχι τεκμήριο ότι έχει δίκιο.
← Όλα τα Focus posts