Stații grafice pentru AI local
Rularea modelelor AI pe propriul hardware înseamnă că datele nu părăsesc compania, costul nu crește cu numărul de interogări, iar latența nu depinde de un serviciu extern. Pentru inferență, fine-tuning și dezvoltare, limita principală nu este puterea de calcul, ci memoria în care încape modelul.
Cum dimensionați memoria
Necesarul de memorie depinde de numărul de parametri ai modelului și de precizia în care este rulat. Ca regulă practică, pentru inferență:
- 16 biți (FP16 / BF16): aproximativ 2 GB pentru fiecare miliard de parametri.
- 8 biți: aproximativ 1 GB pentru fiecare miliard de parametri.
- 4 biți (cuantizare): aproximativ 0,5–0,6 GB pentru fiecare miliard de parametri.
La acestea se adaugă memoria pentru context (KV cache), care crește cu lungimea promptului. Exemple orientative la 4 biți: un model de 8 miliarde de parametri are nevoie de circa 5–6 GB, unul de 32 de miliarde de circa 20 GB, iar unul de 70 de miliarde de circa 40 GB. Fine-tuning-ul cere mult mai multă memorie decât inferența.
Platformele recomandate
Lenovo ThinkStation PGX — memorie unificată de 128 GB
Construit pe superchip-ul NVIDIA GB10 Grace Blackwell: procesor Arm cu 20 de nuclee și GPU Blackwell care împart 128 GB LPDDR5X. Întreaga memorie este disponibilă pentru model, deci încap modele mult mai mari decât pe o placă video dedicată. Potrivit NVIDIA, platforma GB10 rulează inferență pentru modele de până la circa 200 de miliarde de parametri, iar două unități legate prin porturile QSFP de 200 Gbps pot lucra împreună. Vine cu NVIDIA DGX OS și stack-ul software NVIDIA AI preinstalat.
Lenovo ThinkPad P16 Gen 3 — AI local în format mobil
Cu NVIDIA RTX PRO 4000 cu 16 GB memorie video și până la 96 GB RAM, rulează în Windows modele de mărime mică și medie (de ordinul a 7–14 miliarde de parametri, sau mai mari cuantizate la 4 biți), cu instrumente precum PyTorch, Ollama sau LM Studio. Potrivit pentru dezvoltatori și echipe care au nevoie de AI și în deplasare.
Vezi ThinkPad P16 Gen 3 cu RTX PRO 4000 și 96 GB
Cum alegeți
- Modele mari (30–70+ miliarde de parametri), RAG pe documente interne, mai mulți utilizatori: ThinkStation PGX.
- Prototipare, modele mici și medii, lucru în Windows și în deplasare: ThinkPad P16 Gen 3 cu RTX PRO 4000.
- Același sistem și pentru CAD, BIM sau randare: o stație x86 cu placă video RTX (ThinkPad P16 Gen 3 sau ThinkStation P3), deoarece PGX nu rulează Windows.
Întrebări frecvente
Ce diferență este între memoria unificată și memoria video?
O placă video dedicată poate folosi pentru model doar memoria proprie (de exemplu 16 GB). La ThinkStation PGX procesorul și GPU-ul împart aceiași 128 GB, deci modelul poate ocupa aproape toată memoria sistemului.
ThinkStation PGX rulează Windows?
Nu. Folosește NVIDIA DGX OS, bazat pe Linux, pe arhitectură Arm. Este gândit pentru dezvoltarea și rularea modelelor AI, nu pentru aplicații Windows precum AutoCAD sau Revit.
Pot face fine-tuning local?
Da, pentru modele de dimensiuni potrivite memoriei disponibile. Metodele eficiente (de exemplu LoRA sau QLoRA) reduc mult memoria necesară față de antrenarea completă.
Ce garanție are ThinkStation PGX?
Garanția Lenovo pentru ThinkStation PGX este de 1 an, cu intervenție la sediul clientului.
Mă ajutați să aleg platforma pentru un proiect AI?
Da. Spuneți-ne ce modele vreți să rulați, câți utilizatori le vor folosi și ce date procesați, iar noi vă recomandăm configurația potrivită.