Clúster

Modelos e infraestructura

Selección de modelos, economía de inferencia, despliegue local, compresión y serving.

Artículos del blog
55
Tema
IA y agentes

Empieza por el artículo fundamental

Tu bandeja, sin ruido

Recibe la próxima nota de campo sobre IA y agentes

Un correo breve cuando publiquemos. Sin píxeles de seguimiento ni contenido de relleno.

Lo último en esta colección

Un móvil y un portátil reparten un gran modelo de lenguaje entre pestañas del navegador mientras WebRTC mueve activaciones entre ambos IA y agentes

SwarmLLM Review 2026: Inferencia LLM P2P entre móvil y portátil

Review para compradores de SwarmLLM: inferencia 27B en navegador, WebGPU/WebRTC, límites de benchmark, confianza entre peers, seguridad y plan de piloto.

Una onda telefónica atraviesa el LLM de voz Alma y llega a una evaluación de producción IA y agentes

Review de Phonely Alma: ¿Está listo el LLM de voz para producción?

Alma anuncia 182 ms de TTFT, 206 ms de P99 y 0,55 USD por millón de tokens mixtos. Analizamos la evidencia y diseñamos un piloto para compradores.

Capas de conocimiento de Utopia representan la historia conservada IA y agentes

Utopia: evaluar un grafo bitemporal empresarial

Evalúa Utopia para conocimiento empresarial: historial bitemporal, evidencia, límites del autoalojamiento y un piloto concreto antes de invertir.

NVIDIA PAIR enruta peticiones de agentes de IA local entre RTX, Mac y un nodo AMD Strix Halo IA y agentes

NVIDIA PAIR: Routing de IA Local y la Brecha de AMD

PAIR enruta peticiones independientes entre ordenadores locales sin agrupar GPUs. Analizamos cómo funciona, el límite de Strix Halo y qué debe probar un port para AMD.

Tencent Hy4 preview procesa un repositorio de un millón de tokens mediante herramientas y controles de un agente de programación IA y agentes

Análisis de Tencent Hy4 Preview: ¿Merece un piloto con contexto de 1M?

Análisis para compradores con benchmarks de código, WorkBuddy, coste de API, hardware de autoalojamiento, límites y un plan de prueba de dos semanas.

Plataforma educativa PageLM: revisión de alojamiento, licencia y flujo de datos IA y agentes

PageLM: autoalojamiento y uso comercial

PageLM para equipos, con fuentes verificadas: funciones de estudio, flujo de datos, permisos comerciales y evaluación de un piloto formativo.

Directorio completo de artículos

  1. SwarmLLM Review 2026: Inferencia LLM P2P entre móvil y portátil
  2. Review de Phonely Alma: ¿Está listo el LLM de voz para producción?
  3. Utopia: evaluar un grafo bitemporal empresarial
  4. NVIDIA PAIR: Routing de IA Local y la Brecha de AMD
  5. Análisis de Tencent Hy4 Preview: ¿Merece un piloto con contexto de 1M?
  6. PageLM: autoalojamiento y uso comercial
  7. Mac mini M6 vs Mac Studio M5 para IA local: guía de compra
  8. Análisis de FreeToken AI: ¿modelos MoE frontier en una GPU doméstica?
  9. Darkbloom AI: Inferencia Privada en Macs Inactivos
  10. Ox Alpha era GLM-5.3-Flash: qué ha cambiado
  11. Precios de Pika Audio API: ¿SFX cuesta de verdad 20 veces menos?
  12. La apuesta de $13M de Thunder Compute por virtualizar GPUs: guía de compra
  13. AirLLM con 4 GB de VRAM: cómo funciona la inferencia por capas
  14. Qwen3.8-27B: agentes de computer use autoalojados sin exportar capturas
  15. El stack vLLM y Triton de Netflix: 7 lecciones de producción
  16. Transformers.js en el navegador: cuándo llevar la IA local a tu producto
  17. Cómo autoalojar LiteLLM en producción: guía 2026
  18. Wiki empresarial preparada para IA: arquitectura e implementación
  19. ¿Claude añade marcas de agua al texto? Respuesta API 2026
  20. Review de OpenKB: compilador de conocimiento vs RAG
  21. Unsloth Desktop: ¿workstation privada de IA local?
  22. NeMo Switchyard 0.2: ¿routing de agentes sin entrenar?
  23. Firecrawl AnyDoc: 14 formatos a Markdown
  24. Muse Glimmer 30B: ¿está listo el agente local de Meta para producción?
  25. Routing de IA con OmniRoute: Setup y Checklist de Producción
  26. Gemini Robotics 2: control corporal completo y decisión de piloto
  27. pdf-inspector: parser PDF local antes del OCR
  28. Asistente de programación con IA local multimodal: voz, OCR y privacidad
  29. DeepSeek V4 Flash 0731 en un PC de IA: ¿qué funciona?
  30. Cómo afinar Gemma 4 gratis con Unsloth y Colab
  31. Taalas HC1 a examen: ¿compensa un ASIC para un solo LLM?
  32. ¿Qué LLM local puedes ejecutar? Guía de llmfit para tu hardware
  33. Miso TTS autoalojado vs API: coste, latencia y VRAM
  34. Comprime vectores RAG a 2 bits: ¿está lista para producción la cuantización sin datos?
  35. LMCache reportó un TTFT medio 13,7x menor con una caché KV compartida
  36. Compresión LLM sin Pérdida vs 8-bit GGUF: ¿Qué Está Listo?
  37. Review de Cisco Antares: IA local 1B para localizar vulnerabilidades
  38. NVIDIA Nemotron 3.5 ASR: ¿Está listo el STT self-hosted para voice agents?
  39. Kimi K3 para Empresas de la UE: Coste API, Datos y Plan de Piloto
  40. Mesh LLM: ¿Puede un LLM Ejecutarse en Varios Ordenadores?
  41. Review de Bonsai 27B: ¿Puede un LLM de 27B Ejecutarse en un Móvil?
  42. Soofi S: ¿Está listo para empresas el LLM soberano de Alemania?
  43. Colibri Ejecuta GLM-5.2 en Hardware de Consumo. Esta Es la Trampa.
  44. Cuándo los Modelos Locales Superan a las APIs: Calculadora Break-Even para Empresas de la UE
  45. Calculadora de Costes LLM 2026: Coste por Tarea, No por Token
  46. Review de Pxpipe: ¿reduce un 60% el coste de Claude Code?
  47. Más barato por token todavía puede costar más por tarea
  48. Anthropic rechaza prohibir pesos abiertos. La guerra de costes sigue.
  49. Gateways LLM Comparados 2026: LiteLLM vs OpenRouter vs Portkey vs RouteLLM
  50. Alojar LLMs en la UE: Cuándo Salen a Cuenta los Open Weights
  51. Mejores LLM de pesos abiertos 2026: DeepSeek vs Qwen vs Kimi vs GLM vs Llama
  52. Cómo Reducir los Costes de Tokens LLM en 2026
  53. ¿Cuándo vale la pena construir un eval de LLM? Coste, ROI y confiar en el juez
  54. ¿RAG, fine-tuning o contexto largo? Comparativa 2026
  55. Costes de APIs LLM 2026. Cambio de Arquitectura