Mennyi VRAM-ra van szükség az LLM-ek helyi futtatásához?

A helyi LLM futtatásakor a fő kérdés egyszerű: elfér-e a GPU-ban? A válasz a modell méretétől, a kvantálástól és a kontextushossztól függ. Ez az útmutató gyakorlati kiindulópontot ad a megfelelő VRAM-mennyiség kiválasztásához.

Hogyan befolyásolja a kvantálás a VRAM-ot

A kvantálás csökkenti a modellsúlyok tárolására használt pontosságot. Az alacsonyabb bitszámú kvantálás kisebbé teszi a modellt és kevesebb VRAM-ot használ, némi minőségvesztéssel.

Kvant Bit per súly Jellemző felhasználás
Q8_0 8 Nagyon magas minőség
Q6_K ~6,6 Nagyon jó minőség
Q5_K_M ~5,5 Jó minőség és méret
Q4_K_M ~4,5 Jó egyensúly a méret és a minőség között
Q3_K_M ~3,5 Kevesebb VRAM, nagyobb minőségvesztés

A Q4_K_M gyakori választás, ha korlátozott a VRAM. Ha több VRAM áll rendelkezésre, a Q5 vagy Q6 lehetővé teszi ugyanazon modell futtatását kevesebb kvantálással.

Hozzávetőleges VRAM-igény modellméret szerint

Ezek durva becslések a modellsúlyokra vonatkozóan. A ténylegesen szükséges VRAM-mennyiség ennél magasabb, mert a futtatókörnyezet, a KV-gyorsítótár és a kontextus is memóriát használ.

Modellméret Q8_0 Q6_K Q4_K_M Q3_K_M
4B ~5 GB ~4 GB ~3 GB ~2,5 GB
8B ~9 GB ~7 GB ~5,5 GB ~4,5 GB
12B ~13 GB ~10 GB ~8 GB ~6,5 GB
14B ~16 GB ~12 GB ~9 GB ~7,5 GB
27B ~30 GB ~22 GB ~17 GB ~13 GB
32B ~36 GB ~27 GB ~20 GB ~16 GB
70B ~80 GB ~60 GB ~42 GB ~34 GB

Ezek becslések, nem szigorú határok. A különböző modellarchitektúrák és kvantálási formátumok megváltoztathatják a tényleges méretet.

Mit tudnak futtatni a különböző VRAM-mennyiségek

VRAM Gyakorlati tartomány Aktuális példák
8 GB Kis modellek körülbelül 4B és 9B között Gemma 4 E4B, Qwen3.5 9B
12 GB Kis és közepes modellek körülbelül 9B és 14B között Gemma 4 12B, Qwen3.5 9B
16 GB 12B és 27B között alacsonyabb kvantálással Gemma 4 26B-A4B, Qwen3.6 27B Q4-ben
24 GB 27B és 35B között Q4 és Q6 kvantálással Qwen3.8 27B, Gemma 4 31B
32 GB 27B és 35B között magasabb kvantálással Qwen3.8 27B, Gemma 4 31B
48 GB Nagy sűrű modellek alacsonyabb kvantálással 70B-osztályú modellek Q3–Q4 kvantálással
80 GB Nagy sűrű modellek magasabb kvantálással 70B-osztályú modellek Q4–Q6 kvantálással

Ezek a tartományok olyan modellekre vonatkoznak, amelyek súlyai elférnek a GPU-n. A nagy MoE-modellek mások: paramétereiknek csak egy része aktív tokenenként, de a modellnek akkor is tárolnia kell a teljes súlykészletét. Egy 100B vagy annál több összes paraméterrel rendelkező modell tehát nem fér bele egy 100B méretű VRAM-keretbe pusztán azért, mert kevesebb aktív paramétere van.

MoE-modellek

A Mixture-of-Experts modellek több paramétercsoportot tartalmaznak, amelyeket szakértőknek nevezünk. Tokenenként csak néhány szakértőt használnak, ami hatékonyabbá teheti a következtetést, mint egy azonos összes paraméterszámú sűrű modell esetében.

Az inaktív szakértők azonban továbbra is a modell részét képezik. A nagy MoE-modellek ezért sokkal több memóriát igényelhetnek, mint amennyit az aktív paraméterszámuk sugall. A nagyon nagy modellekhez több GPU-ra vagy rendszermemóriába történő kiszervezésre lehet szükség.

A kontextushossz is VRAM-ot használ

A modellsúlyok csak egy részét képezik a memóriaigénynek. A KV-gyorsítótár a kontextus hosszabbodásával növekszik, így ugyanazon modell futtatása 64K kontextussal lényegesen több VRAM-ot igényelhet, mint 4K kontextussal.

  • A hosszabb kontextus több VRAM-ot igényel.
  • A KV-gyorsítótár pontossága befolyásolja a memóriahasználatot.
  • A kötegméret és az egyidejű felhasználók szintén növelik a memóriahasználatot.
  • Hagyjon szabad VRAM-ot a futtatókörnyezet számára, ahelyett hogy teljesen megtöltené a GPU-t modellsúlyokkal.

Gyakorlati tippek

  • Ellenőrizze a futtatni kívánt kvantált modell tényleges méretét.
  • Ne tekintse a modellfájl méretét pontos VRAM-igénynek. Hagyjon helyet a KV-gyorsítótárnak és a futtatókörnyezetnek.
  • Ha a modell nem fér el teljesen a VRAM-ban, egy része kiszervezhető a rendszermemóriába, de a következtetés általában lassabb lesz.
  • Hosszú kontextusú vagy ágens alapú munkaterhelések esetén tervezzen több VRAM-mal, mint amit a modellsúlyok önmagukban igényelnének.
  • Több GPU is feloszthat egy modellt, ha egyetlen GPU nem rendelkezik elegendő VRAM-mal.

Futtassa a DaDesktop-on

Nem kell GPU-t vásárolnia egy helyi LLM futtatásához. A DaDesktop egy felhőalapú asztali környezetet biztosít a szükséges VRAM-mal, így a modellt közvetlenül futtathatja anélkül, hogy birtokolná a hardvert.

Válassza ki a modelljének megfelelő VRAM-szintet, töltse be, és kezdje el használni. Nincs telepítés, nincs hardvervásárlás, nincsenek illesztőprogram-problémák. Tekintse meg az elérhető GPU-kat a lehetőségekért.