Mașini de inteligență, construite de noi.
Hardware-ul nu e un serviciu auxiliar — e produs. Asamblăm, testăm, livrăm și instalăm mașinile pe care rulează AI-ul tău. Mai jos: de ce contează, din ce sunt făcute și șase configurații plus două platforme alternative.
Șase rig-uri, plus două platforme.
Puncte de plecare, nu produse de raft. Fiecare configurație se ajustează pe modelul pe care vrei să-l rulezi și pe datele pe care le ai.
Atelier — inferență & RAG
Pentru echipe mici care rulează modele de 7–34B: asistenți interni, căutare pe documente, viziune.
Pagina tier-ului →Producție — fine-tuning & multi-user
Pentru workload-uri serioase de producție: fine-tuning până la 70B și inferență pentru mai mulți utilizatori simultan.
Pagina tier-ului →Studio — fine-tuning & multi-user
Două plăci profesionale, memorie ECC și răcire lichidă pe Threadripper. Varianta Capacity adaugă nuclee, memorie și stocare pentru dataset-uri mari.
Pagina tier-ului →
Fine-tuning 34–70B, inferență la scară (2× GPU)

Dataset-uri mari, context lung, multi-user intensiv
Memorie unificată — Mac Studio & DGX Spark
Când contează memoria unificată mare, consumul mic și liniștea: două platforme compacte care rulează modele surprinzător de mari la birou.

Inferență modele mari via MLX, silențios, la birou

Prototipare, fine-tuning mic, inferență la birou
Patru motive pentru care AI-ul stă la tine.
Cloud-ul e simplu până la prima factură și prima cerință de conformitate. Un rig propriu schimbă ecuația pe termen lung.
Datele nu pleacă din sediu
Modelul rulează pe mașina ta. Documentele, codul și datele clienților nu se copiază în niciun cloud extern. Pentru domenii reglementate, e singura variantă acceptabilă.
O investiție, nu o chirie lunară
Cloud-ul AI se plătește la oră și crește cu volumul. Un rig propriu se amortizează: după ce e al tău, inferența nu mai are cost marginal per token.
Răspuns local, constant
Fără drum dus-întors la un API extern. Inferența se întâmplă la câțiva metri de utilizator — latență mică și predictibilă, indiferent de internet.
Modelul tău, versiunea ta
Alegi ce model rulezi și când îl schimbi. Nimeni nu-ți deprecază endpoint-ul peste noapte și nu-ți schimbă comportamentul modelului fără să știi.
Din ce e făcută mașina.
Nouă decizii care, împreună, determină ce model poți rula și cât de repede. Le alegem pe fiecare în funcție de workload-ul tău — nimic nu e de raft.
Placa video — motorul
Unitatea care face calculul modelelor. Aici se întâmplă training-ul și inferența.
Determină cât de repede și ce mărime de model poți rula. NVIDIA (CUDA) rămâne standardul pentru compatibilitate cu ecosistemul AI.
RTX 5090 pentru atelier, RTX 6000 Pro pentru producție, configurații 2× pentru studio.
Memoria video
Memoria de pe placă în care trebuie să încapă modelul plus contextul.
E prima limită reală. Regula practică: ~2 GB per miliard de parametri la 16-bit, ~0,5 GB la 4-bit. Modelul nu încape → nu rulează.
Dimensionăm VRAM-ul total pe cel mai mare model pe care vrei să-l rulezi, cu marjă pentru context.
Procesorul
Orchestrează sistemul, preprocesează datele și alimentează GPU-urile.
La rig-uri multi-GPU contează numărul de linii PCIe și de nuclee — un CPU slab devine gâtul de sticlă care ține GPU-urile flămânde.
Ryzen pentru single-GPU, Threadripper pentru configurațiile cu 2+ plăci și memorie ECC.
Memoria de sistem
Memoria principală, folosită la pregătirea datelor și la offload.
Regulă: 1,5–2× VRAM-ul total. Prea puțină RAM înseamnă staging lent al dataset-urilor și offload imposibil.
64 GB la low-end, până la 512 GB DDR5 ECC la configurațiile de capacitate.
Stocare NVMe
Discurile pe care stau dataset-urile, checkpoint-urile și modelele.
La training, viteza de citire alimentează pipeline-ul de date; un checkpoint de zeci de GB trebuie scris fără să blocheze GPU-urile.
NVMe rapid, în RAID pentru throughput, dimensionat pe volumul de date — de la 4 TB la 24 TB.
Placa de bază & PCIe
Coloana vertebrală: sloturile PCIe și liniile care leagă GPU-urile de CPU.
Numărul de sloturi PCIe și bifurcarea liniilor decid câte GPU-uri intră și la ce lățime de bandă comunică.
X870E pentru single-GPU (AM5), TRX50 pentru multi-GPU și ECC (Threadripper).
Răcirea
Sistemul care ține componentele în fereastra termică sigură.
GPU-urile degajă mult; peste prag, plăcile fac throttling și pierzi throughput. Stabilitatea termică = performanță constantă.
Cooler pe aer la AM5, răcire lichidă 360 mm la configurațiile Threadripper.
Sursa (PSU)
Alimentarea, dimensionată cu rezervă pentru rulare stabilă sub sarcină.
Un rig cu 2 plăci profesionale poate cere peste 2 kW. Sursă subdimensionată sau fără headroom = instabilitate sub sarcină.
Surse cu marjă de 20–30% — de la 1000 W la 2200 W, după configurație.
Rețeaua
Legătura spre stocare și, la cluster, între noduri.
Pentru single-node, 10–25 GbE spre stocare. Pentru training distribuit, interconectarea rapidă între GPU-uri decide dacă scalarea e reală.
10/25 GbE la producție, interconectare rapidă la configurațiile de cluster.
Livrată gata de producție.
Pornim de la workload-ul tău, alegem componentele, asamblăm și testăm pe date reale, apoi instalăm la sediu și rămânem lângă sistem.
Cere o configurație pe workload-ul tău