Γιατί ένα αραιό μοντέλο τρέχει πιο γρήγορα από μεγαλύτερο σε μικρή GPU
Σε ενσωματωμένα GPU, η ταχύτητα παραγωγής περιορίζεται από το bandwidth μνήμης: κάθε token «ρέει» τα ενεργά weights μπροστά από το τσιπ. Γι' αυτό ένα mixture-of-experts μοντέλο που ενεργοποιεί λίγα δισεκατομμύρια παραμέτρους ανά token μπορεί να μοιάζει ταχύτερο από ένα μικρότερο dense.
Υπέρ- Αραιά (mixture-of-experts) μοντέλα με λίγες ενεργές παραμέτρους ταιριάζουν καλά σε bandwidth-bound hardware.
- Δίνει σε οικονομικά τοπικά setups δρόμο προς μεγαλύτερα μοντέλα χωρίς discrete GPU.
- Το συνολικό μέγεθος του μοντέλου πρέπει να χωράει στη μνήμη, ακόμη κι αν μόνο μέρος είναι ενεργό ανά token.
- Οι ισχυρισμοί benchmark αλλάζουν γρήγορα· επαλήθευσε συγκεκριμένο μοντέλο στο δικό σου workload.
Η γνώμη μαςΔύο έντιμοι δρόμοι για ένα μέτριο τοπικό κουτί: dense μοντέλο με εξωτερική GPU, ή αραιό mixture-of-experts που μένει γρήγορο στο ενσωματωμένο. Ταίριαξε την αρχιτεκτονική στο στενό.
Πηγή: On mixture-of-experts and memory-bound hardware
← Όλα τα Focus posts