Κυριαρχία · 2026-09-16 · 1:42

Γιατί ένα αραιό μοντέλο τρέχει πιο γρήγορα από μεγαλύτερο σε μικρή GPU

Σε ενσωματωμένα GPU, η ταχύτητα παραγωγής περιορίζεται από το bandwidth μνήμης: κάθε token «ρέει» τα ενεργά weights μπροστά από το τσιπ. Γι' αυτό ένα mixture-of-experts μοντέλο που ενεργοποιεί λίγα δισεκατομμύρια παραμέτρους ανά token μπορεί να μοιάζει ταχύτερο από ένα μικρότερο dense.

Υπέρ
  • Αραιά (mixture-of-experts) μοντέλα με λίγες ενεργές παραμέτρους ταιριάζουν καλά σε bandwidth-bound hardware.
  • Δίνει σε οικονομικά τοπικά setups δρόμο προς μεγαλύτερα μοντέλα χωρίς discrete GPU.
Προσοχή
  • Το συνολικό μέγεθος του μοντέλου πρέπει να χωράει στη μνήμη, ακόμη κι αν μόνο μέρος είναι ενεργό ανά token.
  • Οι ισχυρισμοί benchmark αλλάζουν γρήγορα· επαλήθευσε συγκεκριμένο μοντέλο στο δικό σου workload.
Η γνώμη μαςΔύο έντιμοι δρόμοι για ένα μέτριο τοπικό κουτί: dense μοντέλο με εξωτερική GPU, ή αραιό mixture-of-experts που μένει γρήγορο στο ενσωματωμένο. Ταίριαξε την αρχιτεκτονική στο στενό.

Πηγή: On mixture-of-experts and memory-bound hardware

← Όλα τα Focus posts