Inteligencia Artificialdocker-readypermissive-license
vLLM: la mejor alternativa Open Source a OpenAI API en 2026
vLLM es un motor de inferencia de alto rendimiento para servir modelos de lenguaje a gran escala con máximo throughput, exponiendo una API compatible con OpenAI para producción.
Ficha técnica
- Licencia
- Apache-2.0
- Categoría
- Inteligencia Artificial
- Sustituye a
- OpenAI API
- Stack técnico
- PythonCUDA
Funcionalidades principales
- Throughput muy superior gracias a PagedAttention
- API compatible con OpenAI
- Soporta decenas de arquitecturas de modelos
vLLM vs. OpenAI API
Ventajas
- Pensado específicamente para servir LLMs en producción a escala
A tener en cuenta
- Requiere GPU con VRAM suficiente para el modelo elegido
Guía rápida de instalación con Docker
Copia este docker-compose.yml, ajusta las contraseñas de ejemplo y ejecuta docker compose up -d en tu servidor. Ver la guía completa paso a paso →
docker-compose.yml
version: "3.9"
services:
vllm:
image: vllm/vllm-openai:latest
restart: unless-stopped
ports:
- "8000:8000"
command: ["--model", "mistralai/Mistral-7B-Instruct-v0.2"]
volumes:
- vllm_cache:/root/.cache/huggingface
volumes:
vllm_cache: