Τοπικό 27B μοντέλο: το στενό είναι η μνήμη, όχι το τσιπ
Μια πρακτική δοκιμή ενός 27B μοντέλου σε ενσωματωμένα γραφικά δείχνει το πραγματικό στενό: σε κοινή μνήμη, κάθε token «ρέει» όλα τα weights μπροστά από το τσιπ, άρα η ταχύτητα ορίζεται από το bandwidth μνήμης, όχι την υπολογιστική ισχύ.
Υπέρ
Δωρεάν κέρδη που μετράνε: πιο σφιχτό quantisation που χωράει σε VRAM, συν speculative decoding, ~διπλασιάζουν την απόδοση.
Μια εξωτερική GPU μέσω USB4/Thunderbolt αρκεί για inference — το text generation μόλις που χρησιμοποιεί τον δίαυλο όταν τα weights είναι resident.
Προσοχή
Τα ενσωματωμένα GPU μένουν αργά για μεγάλα dense μοντέλα όσο κι αν τα ρυθμίσεις.
Το τυφλό offload όλων των layers όταν το μοντέλο δεν χωράει το κάνει δραματικά πιο αργό, όχι πιο γρήγορο.
Η γνώμη μαςΓια τοπικά, κυρίαρχα LLM ο κανόνας είναι ωμός: αγόρασε VRAM, όχι bandwidth. Το περσινό μοντέλο που κατέχεις με μηδέν κόστος ανά token συχνά νικά το φετινό που νοικιάζεις.