E.D.A.T.A. / EST. 2017
— SERVICIU / EDT-SFT-04

Modelele tale, ca un API.

Un endpoint pe serverul tău pe care aplicațiile îl apelează ca pe orice API — compatibil cu ce folosesc deja dezvoltatorii, dar cu datele care nu pleacă și fără cost per token.

Compatibil OpenAI/Rulat on-premise/Fără cost per token

Evaluare fără cost · Compatibil cu SDK-urile tale · Fără lock-in

Infrastructură de inferență — hardware și cod
FIG. 01 — ENDPOINT DE INFERENȚĂ / RULAT ON-PREMISE
COMPATIBIL OPENAI/STREAMING/EMBEDDINGS/CONTROL DE ACCES
— PROBLEMA

API-urile publice au trei probleme.

Sunt ușor de pornit — și exact de asta scapi din vedere ce plătești cu fiecare cerere.

EDT / RISC-01 / DATE

Prompturile pleacă afară

Fiecare cerere trimite datele și contextul tău către un server extern. Pentru date sensibile, e o scurgere cu abonament.

EDT / RISC-02 / COST

Plătești per token, la nesfârșit

Factura crește cu utilizarea. Cu cât aplicația ta are mai mult succes, cu atât te costă mai mult să meargă.

EDT / RISC-03 / DEPENDENȚĂ

Furnizorul decide, nu tu

Schimbă prețul, modelul sau îl retrage — și comportamentul aplicației tale se schimbă peste noapte, fără voia ta.

— REZULTATUL

Același mod de a apela. Alt loc unde rulează.

Codul tău nu se schimbă. Se schimbă doar unde ajung datele și cine plătește pentru fiecare token.

Compatibil
Același mod de a apela
Local
Rulează pe serverul tău
0 / token
Fără cost per cerere
Al tău
Alegi și schimbi modelul
— CE OFERĂ ENDPOINT-UL

Tot ce aștepți de la un API de inferență.

Aceleași funcții ca la serviciile publice — doar că rulează la tine și sunt sub controlul tău.

EDT-API-01 / CHAT & COMPLETIONS

Endpoint compatibil OpenAI — drop-in pentru codul pe care îl ai deja.

EDT-API-02 / STREAMING

Răspuns pe măsură ce e generat, exact ca la API-urile publice.

EDT-API-03 / EMBEDDINGS

Pentru căutare semantică și RAG, generate tot local.

EDT-API-04 / MODELE MULTIPLE

Rulezi și comuți între mai multe modele open-source.

EDT-API-05 / CHEI & ACCES

Chei de API, limite și acces pe aplicație sau echipă.

EDT-API-06 / MONITORIZARE

Vezi utilizarea, latența și ce model a răspuns la fiecare cerere.

— CUM FUNCȚIONEAZĂ

De la model la endpoint.

Cinci pași până când aplicațiile tale apelează inteligență care rulează la tine în sediu.

01

Alegem modelul

Pe workload-ul, limba și cerințele tale de latență.

02

Servim pe rig

Modelul rulează pe hardware-ul tău, optimizat pentru inferență.

03

Endpoint în rețea

Un URL în rețeaua ta pe care aplicațiile îl apelează ca pe orice API.

04

Chei & acces

Controlezi cine apelează, cu ce limite și pentru ce model.

05

Monitorizare & scalare

Urmărim utilizarea și creștem capacitatea când e nevoie.

— COMPATIBIL CU

Merge cu ce ai deja.

Fiindcă e pe un standard deschis, se leagă de uneltele și codul pe care le folosesc dezvoltatorii tăi acum.

OPENAI SDK

Schimbi doar base URL-ul din cod

LANGCHAIN / LLAMAINDEX

Framework-uri de aplicații AI

APLICAȚIILE TALE

Orice apelează un API HTTP

cURL / HTTP

Standard, fără niciun SDK

RAG & AGENȚI

Ca backend de inferență

CI / SCRIPTURI

Automatizări și procesare în lot

— API PUBLIC VS. API-UL TĂU

Aceeași interfață, alt contract.

Nu schimbi cum apelezi. Schimbi unde stau datele, cine plătește și cine deține modelul.

Criteriu
API public
API-ul tău
Unde stau datele
Cloud extern
Serverul tău
Cost
Per token, crește
Investiție, apoi fix
Latență
Depinde de rețea
Local, constantă
Control model
Al furnizorului
Al tău — alegi/schimbi
Disponibilitate
Depinde de furnizor
A ta, mereu
— CE LIVRĂM

Un endpoint gata de producție.

01
Endpoint compatibil OpenAI

Chat, completions, embeddings — pe standardul cunoscut.

02
Model(e) rulate local

Open-source sau fine-tunate de noi, pe rig-ul tău.

03
Chei, limite & acces

Control pe aplicație și echipă, cu chei de API.

04
Monitorizare

Utilizare, latență și model per cerere.

05
Optimizare inferență

Cuantizare și tuning pentru throughput și latență.

06
Instalare & suport

Punem în funcțiune și rămânem lângă sistem.

— GARANȚIA

Inteligența ta, pe regulile tale.

Un API extern e comod până devine o dependență scumpă și o scurgere de date. Al tău nu e nici, nici.

  • ON-PREMISEPrompturile și datele nu părăsesc rețeaua ta. Nimic către un API extern.
  • FĂRĂ COST PER TOKENOdată instalat, apelezi cât vrei. Fără factură care crește cu succesul.
  • CONTROLAlegi modelul, versiunea și cine are acces. Nimeni nu ți-l schimbă.
  • FĂRĂ LOCK-INModele open-source pe hardware-ul tău, pe un standard deschis.
— ÎNTREBĂRI

Ce te-ai putea întreba.

01E chiar compatibil cu OpenAI SDK?

Da. Expunem un endpoint compatibil — în cele mai multe cazuri schimbi doar base URL-ul și cheia, iar codul existent merge mai departe.

02Ce modele pot rula?

Modele open-source (Llama, Mistral, Qwen și altele) și modele fine-tunate de noi pe datele tale. Alegem împreună ce se potrivește workload-ului.

03Câte cereri simultane duce?

Depinde de rig și de model. Dimensionăm hardware-ul pe traficul tău estimat, cu marjă de creștere.

04Pot rula mai multe modele deodată?

Da. În funcție de hardware, servim mai multe modele simultan sau comutăm între ele la cerere.

05Datele din prompturi ajung undeva?

Nu. Totul rulează local — prompturile, contextul și răspunsurile rămân în rețeaua ta.

06Cât costă?

Depinde de model și de hardware. Îți dăm o cifră fixă după evaluare — care e gratuită.

— PASUL URMĂTOR

Mută inferența la tine în sediu.

O discuție de evaluare, fără cost. Ne spui ce apelezi și cât, îți spunem ce endpoint și ce hardware îți trebuie.

Fără cost · Fără angajament · Datele rămân la tine