Modelos e infraestructura
Selección de modelos, economía de inferencia, despliegue local, compresión y serving.
- Artículos del blog
- 46
- Tema
- IA y agentes
Empieza por el artículo fundamental
Lo último en esta colección
Ox Alpha Free: configuración, privacidad y guía de compra
Usa el modelo stealth de programación con contexto de 1M en OpenCode u OpenRouter. Compara IDs, privacidad, costes extra y un piloto seguro.
Precios de Pika Audio API: ¿SFX cuesta de verdad 20 veces menos?
Pika publica SFX a 0,0002 USD por segundo y otros tres modelos de audio. Calcula el umbral, los límites y el encaje en producción antes de migrar.
La apuesta de $13M de Thunder Compute por virtualizar GPUs: guía de compra
Thunder Compute afirma que el pooling de GPU recupera capacidad ociosa. Compara virtualización de red, MIG, vGPU y passthrough y diseña un piloto empresarial medible.
AirLLM con 4 GB de VRAM: cómo funciona la inferencia por capas
AirLLM ejecuta modelos mucho mayores que la memoria de la GPU transmitiendo pesos por capas. Separamos el dato de VRAM del coste en disco, latencia y producción.
Qwen3.8-27B: agentes de computer use autoalojados sin exportar capturas
Un modelo de pesos abiertos lidera ahora los benchmarks de escritorio. Qué cambia para la automatización de back office que no puede salir de tu red.
El stack vLLM y Triton de Netflix: 7 lecciones de producción
Netflix eligió vLLM por encaje operativo y encontró los cuellos de botella reales en el decoding restringido, los despliegues, la carga de modelos y las métricas. Esto es lo que conviene copiar y lo que un equipo menor debería comprar.
Directorio completo de artículos
- Ox Alpha Free: configuración, privacidad y guía de compra
- Precios de Pika Audio API: ¿SFX cuesta de verdad 20 veces menos?
- La apuesta de $13M de Thunder Compute por virtualizar GPUs: guía de compra
- AirLLM con 4 GB de VRAM: cómo funciona la inferencia por capas
- Qwen3.8-27B: agentes de computer use autoalojados sin exportar capturas
- El stack vLLM y Triton de Netflix: 7 lecciones de producción
- Transformers.js en el navegador: cuándo llevar la IA local a tu producto
- Cómo autoalojar LiteLLM en producción: guía 2026
- Wiki empresarial preparada para IA: arquitectura e implementación
- ¿Claude añade marcas de agua al texto? Respuesta API 2026
- Review de OpenKB: compilador de conocimiento vs RAG
- Unsloth Desktop: ¿workstation privada de IA local?
- NeMo Switchyard 0.2: ¿routing de agentes sin entrenar?
- Firecrawl AnyDoc: 14 formatos a Markdown
- Muse Glimmer 30B: ¿está listo el agente local de Meta para producción?
- Routing de IA con OmniRoute: Setup y Checklist de Producción
- Gemini Robotics 2: control corporal completo y decisión de piloto
- pdf-inspector: parser PDF local antes del OCR
- Asistente de programación con IA local multimodal: voz, OCR y privacidad
- DeepSeek V4 Flash 0731 en un PC de IA: ¿qué funciona?
- Cómo afinar Gemma 4 gratis con Unsloth y Colab
- Taalas HC1 a examen: ¿compensa un ASIC para un solo LLM?
- ¿Qué LLM local puedes ejecutar? Guía de llmfit para tu hardware
- Miso TTS autoalojado vs API: coste, latencia y VRAM
- Reduce 16x la memoria de vectores de tu RAG: ¿está lista para producción la cuantización sin datos?
- Una caché KV compartida redujo 14x la latencia de inferencia de un LLM, sin GPUs nuevas
- Compresión LLM sin Pérdida vs 8-bit GGUF: ¿Qué Está Listo?
- Review de Cisco Antares: IA local 1B para localizar vulnerabilidades
- NVIDIA Nemotron 3.5 ASR: ¿Está listo el STT self-hosted para voice agents?
- Kimi K3 para Empresas de la UE: Coste API, Datos y Plan de Piloto
- Mesh LLM: ¿Puede un LLM Ejecutarse en Varios Ordenadores?
- Review de Bonsai 27B: ¿Puede un LLM de 27B Ejecutarse en un Móvil?
- Soofi S: ¿Está listo para empresas el LLM soberano de Alemania?
- Colibri Ejecuta GLM-5.2 en Hardware de Consumo. Esta Es la Trampa.
- Cuándo los Modelos Locales Superan a las APIs: Calculadora Break-Even para Empresas de la UE
- Calculadora de Costes LLM 2026: Coste por Tarea, No por Token
- Review de Pxpipe: ¿reduce un 60% el coste de Claude Code?
- Más barato por token. Más caro por respuesta.
- Dario Le Declaró la Guerra al Código Abierto. La Guerra Real Es Por Tu Factura de IA.
- Gateways LLM Comparados 2026: LiteLLM vs OpenRouter vs Portkey vs RouteLLM
- Alojar LLMs en la UE: Cuándo Salen a Cuenta los Open Weights
- Mejores LLM de pesos abiertos 2026: DeepSeek vs Qwen vs Kimi vs GLM vs Llama
- Cómo Reducir los Costes de Tokens LLM en 2026
- ¿Cuándo vale la pena construir un eval de LLM? Coste, ROI y confiar en el juez
- ¿RAG, fine-tuning o contexto largo? Comparativa 2026
- Costes de APIs LLM 2026. Cambio de Arquitectura