Clúster

Modelos e infraestructura

Selección de modelos, economía de inferencia, despliegue local, compresión y serving.

Artículos del blog
46
Tema
IA y agentes

Empieza por el artículo fundamental

Lo último en esta colección

Modelo de IA stealth gratuito Ox Alpha mediante OpenCode Zen y OpenRouter con controles de privacidad y costes IA y agentes

Ox Alpha Free: configuración, privacidad y guía de compra

Usa el modelo stealth de programación con contexto de 1M en OpenCode u OpenRouter. Compara IDs, privacidad, costes extra y un piloto seguro.

Cuatro modelos de la API Pika Audio para efectos, voz, música y bandas sonoras sincronizadas con controles de coste IA y agentes

Precios de Pika Audio API: ¿SFX cuesta de verdad 20 veces menos?

Pika publica SFX a 0,0002 USD por segundo y otros tres modelos de audio. Calcula el umbral, los límites y el encaje en producción antes de migrar.

Cargas GPU compartiendo una flota de aceleradores mediante una capa de virtualización IA y agentes

La apuesta de $13M de Thunder Compute por virtualizar GPUs: guía de compra

Thunder Compute afirma que el pooling de GPU recupera capacidad ociosa. Compara virtualización de red, MIG, vGPU y passthrough y diseña un piloto empresarial medible.

AirLLM transmite una capa del modelo desde disco y RAM hasta una GPU con poca VRAM IA y agentes

AirLLM con 4 GB de VRAM: cómo funciona la inferencia por capas

AirLLM ejecuta modelos mucho mayores que la memoria de la GPU transmitiendo pesos por capas. Separamos el dato de VRAM del coste en disco, latencia y producción.

Agente de pantalla autoalojado operando una interfaz de escritorio en un despliegue de una sola GPU IA y agentes

Qwen3.8-27B: agentes de computer use autoalojados sin exportar capturas

Un modelo de pesos abiertos lidera ahora los benchmarks de escritorio. Qué cambia para la automatización de back office que no puede salir de tu red.

Stack de inferencia por capas con vLLM y NVIDIA Triton IA y agentes

El stack vLLM y Triton de Netflix: 7 lecciones de producción

Netflix eligió vLLM por encaje operativo y encontró los cuellos de botella reales en el decoding restringido, los despliegues, la carga de modelos y las métricas. Esto es lo que conviene copiar y lo que un equipo menor debería comprar.

Directorio completo de artículos

  1. Ox Alpha Free: configuración, privacidad y guía de compra
  2. Precios de Pika Audio API: ¿SFX cuesta de verdad 20 veces menos?
  3. La apuesta de $13M de Thunder Compute por virtualizar GPUs: guía de compra
  4. AirLLM con 4 GB de VRAM: cómo funciona la inferencia por capas
  5. Qwen3.8-27B: agentes de computer use autoalojados sin exportar capturas
  6. El stack vLLM y Triton de Netflix: 7 lecciones de producción
  7. Transformers.js en el navegador: cuándo llevar la IA local a tu producto
  8. Cómo autoalojar LiteLLM en producción: guía 2026
  9. Wiki empresarial preparada para IA: arquitectura e implementación
  10. ¿Claude añade marcas de agua al texto? Respuesta API 2026
  11. Review de OpenKB: compilador de conocimiento vs RAG
  12. Unsloth Desktop: ¿workstation privada de IA local?
  13. NeMo Switchyard 0.2: ¿routing de agentes sin entrenar?
  14. Firecrawl AnyDoc: 14 formatos a Markdown
  15. Muse Glimmer 30B: ¿está listo el agente local de Meta para producción?
  16. Routing de IA con OmniRoute: Setup y Checklist de Producción
  17. Gemini Robotics 2: control corporal completo y decisión de piloto
  18. pdf-inspector: parser PDF local antes del OCR
  19. Asistente de programación con IA local multimodal: voz, OCR y privacidad
  20. DeepSeek V4 Flash 0731 en un PC de IA: ¿qué funciona?
  21. Cómo afinar Gemma 4 gratis con Unsloth y Colab
  22. Taalas HC1 a examen: ¿compensa un ASIC para un solo LLM?
  23. ¿Qué LLM local puedes ejecutar? Guía de llmfit para tu hardware
  24. Miso TTS autoalojado vs API: coste, latencia y VRAM
  25. Reduce 16x la memoria de vectores de tu RAG: ¿está lista para producción la cuantización sin datos?
  26. Una caché KV compartida redujo 14x la latencia de inferencia de un LLM, sin GPUs nuevas
  27. Compresión LLM sin Pérdida vs 8-bit GGUF: ¿Qué Está Listo?
  28. Review de Cisco Antares: IA local 1B para localizar vulnerabilidades
  29. NVIDIA Nemotron 3.5 ASR: ¿Está listo el STT self-hosted para voice agents?
  30. Kimi K3 para Empresas de la UE: Coste API, Datos y Plan de Piloto
  31. Mesh LLM: ¿Puede un LLM Ejecutarse en Varios Ordenadores?
  32. Review de Bonsai 27B: ¿Puede un LLM de 27B Ejecutarse en un Móvil?
  33. Soofi S: ¿Está listo para empresas el LLM soberano de Alemania?
  34. Colibri Ejecuta GLM-5.2 en Hardware de Consumo. Esta Es la Trampa.
  35. Cuándo los Modelos Locales Superan a las APIs: Calculadora Break-Even para Empresas de la UE
  36. Calculadora de Costes LLM 2026: Coste por Tarea, No por Token
  37. Review de Pxpipe: ¿reduce un 60% el coste de Claude Code?
  38. Más barato por token. Más caro por respuesta.
  39. Dario Le Declaró la Guerra al Código Abierto. La Guerra Real Es Por Tu Factura de IA.
  40. Gateways LLM Comparados 2026: LiteLLM vs OpenRouter vs Portkey vs RouteLLM
  41. Alojar LLMs en la UE: Cuándo Salen a Cuenta los Open Weights
  42. Mejores LLM de pesos abiertos 2026: DeepSeek vs Qwen vs Kimi vs GLM vs Llama
  43. Cómo Reducir los Costes de Tokens LLM en 2026
  44. ¿Cuándo vale la pena construir un eval de LLM? Coste, ROI y confiar en el juez
  45. ¿RAG, fine-tuning o contexto largo? Comparativa 2026
  46. Costes de APIs LLM 2026. Cambio de Arquitectura