Mennyi VRAM-ra van szükség az LLM-ek helyi futtatásához?
A helyi LLM futtatásakor a fő kérdés egyszerű: elfér-e a GPU-ban? A válasz a modell méretétől, a kvantálástól és a kontextushossztól függ. Ez az útmutató gyakorlati kiindulópontot ad a megfelelő VRAM-mennyiség kiválasztásához.
Hogyan befolyásolja a kvantálás a VRAM-ot
A kvantálás csökkenti a modellsúlyok tárolására használt pontosságot. Az alacsonyabb bitszámú kvantálás kisebbé teszi a modellt és kevesebb VRAM-ot használ, némi minőségvesztéssel.
| Kvant | Bit per súly | Jellemző felhasználás |
|---|---|---|
| Q8_0 | 8 | Nagyon magas minőség |
| Q6_K | ~6,6 | Nagyon jó minőség |
| Q5_K_M | ~5,5 | Jó minőség és méret |
| Q4_K_M | ~4,5 | Jó egyensúly a méret és a minőség között |
| Q3_K_M | ~3,5 | Kevesebb VRAM, nagyobb minőségvesztés |
A Q4_K_M gyakori választás, ha korlátozott a VRAM. Ha több VRAM áll rendelkezésre, a Q5 vagy Q6 lehetővé teszi ugyanazon modell futtatását kevesebb kvantálással.
Hozzávetőleges VRAM-igény modellméret szerint
Ezek durva becslések a modellsúlyokra vonatkozóan. A ténylegesen szükséges VRAM-mennyiség ennél magasabb, mert a futtatókörnyezet, a KV-gyorsítótár és a kontextus is memóriát használ.
| Modellméret | Q8_0 | Q6_K | Q4_K_M | Q3_K_M |
|---|---|---|---|---|
| 4B | ~5 GB | ~4 GB | ~3 GB | ~2,5 GB |
| 8B | ~9 GB | ~7 GB | ~5,5 GB | ~4,5 GB |
| 12B | ~13 GB | ~10 GB | ~8 GB | ~6,5 GB |
| 14B | ~16 GB | ~12 GB | ~9 GB | ~7,5 GB |
| 27B | ~30 GB | ~22 GB | ~17 GB | ~13 GB |
| 32B | ~36 GB | ~27 GB | ~20 GB | ~16 GB |
| 70B | ~80 GB | ~60 GB | ~42 GB | ~34 GB |
Ezek becslések, nem szigorú határok. A különböző modellarchitektúrák és kvantálási formátumok megváltoztathatják a tényleges méretet.
Mit tudnak futtatni a különböző VRAM-mennyiségek
| VRAM | Gyakorlati tartomány | Aktuális példák |
|---|---|---|
| 8 GB | Kis modellek körülbelül 4B és 9B között | Gemma 4 E4B, Qwen3.5 9B |
| 12 GB | Kis és közepes modellek körülbelül 9B és 14B között | Gemma 4 12B, Qwen3.5 9B |
| 16 GB | 12B és 27B között alacsonyabb kvantálással | Gemma 4 26B-A4B, Qwen3.6 27B Q4-ben |
| 24 GB | 27B és 35B között Q4 és Q6 kvantálással | Qwen3.8 27B, Gemma 4 31B |
| 32 GB | 27B és 35B között magasabb kvantálással | Qwen3.8 27B, Gemma 4 31B |
| 48 GB | Nagy sűrű modellek alacsonyabb kvantálással | 70B-osztályú modellek Q3–Q4 kvantálással |
| 80 GB | Nagy sűrű modellek magasabb kvantálással | 70B-osztályú modellek Q4–Q6 kvantálással |
Ezek a tartományok olyan modellekre vonatkoznak, amelyek súlyai elférnek a GPU-n. A nagy MoE-modellek mások: paramétereiknek csak egy része aktív tokenenként, de a modellnek akkor is tárolnia kell a teljes súlykészletét. Egy 100B vagy annál több összes paraméterrel rendelkező modell tehát nem fér bele egy 100B méretű VRAM-keretbe pusztán azért, mert kevesebb aktív paramétere van.
MoE-modellek
A Mixture-of-Experts modellek több paramétercsoportot tartalmaznak, amelyeket szakértőknek nevezünk. Tokenenként csak néhány szakértőt használnak, ami hatékonyabbá teheti a következtetést, mint egy azonos összes paraméterszámú sűrű modell esetében.
Az inaktív szakértők azonban továbbra is a modell részét képezik. A nagy MoE-modellek ezért sokkal több memóriát igényelhetnek, mint amennyit az aktív paraméterszámuk sugall. A nagyon nagy modellekhez több GPU-ra vagy rendszermemóriába történő kiszervezésre lehet szükség.
A kontextushossz is VRAM-ot használ
A modellsúlyok csak egy részét képezik a memóriaigénynek. A KV-gyorsítótár a kontextus hosszabbodásával növekszik, így ugyanazon modell futtatása 64K kontextussal lényegesen több VRAM-ot igényelhet, mint 4K kontextussal.
- A hosszabb kontextus több VRAM-ot igényel.
- A KV-gyorsítótár pontossága befolyásolja a memóriahasználatot.
- A kötegméret és az egyidejű felhasználók szintén növelik a memóriahasználatot.
- Hagyjon szabad VRAM-ot a futtatókörnyezet számára, ahelyett hogy teljesen megtöltené a GPU-t modellsúlyokkal.
Gyakorlati tippek
- Ellenőrizze a futtatni kívánt kvantált modell tényleges méretét.
- Ne tekintse a modellfájl méretét pontos VRAM-igénynek. Hagyjon helyet a KV-gyorsítótárnak és a futtatókörnyezetnek.
- Ha a modell nem fér el teljesen a VRAM-ban, egy része kiszervezhető a rendszermemóriába, de a következtetés általában lassabb lesz.
- Hosszú kontextusú vagy ágens alapú munkaterhelések esetén tervezzen több VRAM-mal, mint amit a modellsúlyok önmagukban igényelnének.
- Több GPU is feloszthat egy modellt, ha egyetlen GPU nem rendelkezik elegendő VRAM-mal.
Futtassa a DaDesktop-on
Nem kell GPU-t vásárolnia egy helyi LLM futtatásához. A DaDesktop egy felhőalapú asztali környezetet biztosít a szükséges VRAM-mal, így a modellt közvetlenül futtathatja anélkül, hogy birtokolná a hardvert.
Válassza ki a modelljének megfelelő VRAM-szintet, töltse be, és kezdje el használni. Nincs telepítés, nincs hardvervásárlás, nincsenek illesztőprogram-problémák. Tekintse meg az elérhető GPU-kat a lehetőségekért.