API de inferencia
Inferencia de modelos abiertos en infraestructura propia en España
Serenity Edge es una API compatible con OpenAI que sirve modelos abiertos y la familia Orion desde las GPU de Substrate AI en Valencia. Sin retención de datos. Residencia de datos en la Unión Europea.
Cambia la URL base. El resto de tu código no cambia.
curl https://api.serenityedge.ai/v1/chat/completions \
-H "Authorization: Bearer $SERENITY_EDGE_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.6-35b-a3b",
"messages": [{"role": "user", "content": "Hola"}],
"stream": true
}'Cualquier SDK o herramienta compatible con OpenAI funciona con Serenity Edge.
- Contexto de 131.072 tokens
- Hasta 32.768 tokens de salida
- Modelos servidos en precisión NVFP4
- Precios por millón de tokens, en USD
Lo esencial
Compatible con OpenAI
Chat completions con streaming, llamadas a herramientas, salidas estructuradas y caché de prefijo. Funciona con los SDK y las herramientas que ya usas.
Tus datos se quedan en España
Las peticiones se procesan en infraestructura propia de Substrate AI en Valencia. Los prompts y las respuestas nunca se escriben en disco ni en registros; los prefijos de los prompts pueden permanecer en la memoria de caché menos de 24 horas y nunca se usan para entrenar.
Dos familias, un mismo despliegue
Modelos abiertos como Qwen y Orion, la familia propia de Serenity, servidos sobre la misma infraestructura y con la misma API.
Tres formas de acceder
A través de OpenRouter, seleccionando el proveedor Serenity Edge.
Con una cuenta de Serenity Star: claves de API y créditos.
Con contrato, para empresas que necesitan condiciones específicas y SLA.