Modelos e infraestructura
Selección de modelos, economía de inferencia, despliegue local, compresión y serving.
27Empieza por el artículo fundamental
Lo último en esta colección
DeepSeek V4 Flash 0731 en un PC de IA: ¿qué funciona?
¿Puede un equipo GB10, Strix Halo o Gorgon Halo ejecutar DeepSeek V4 Flash 0731? Una guía de compra sobre memoria, cuantización, privacidad, observabilidad y preparación para producción.
Cómo afinar Gemma 4 gratis con Unsloth y Colab
Un piloto gratuito en el navegador sí es posible. Esta guía explica el flujo, los límites del discurso viral y el salto necesario hasta producción.
Taalas HC1 a examen: ¿compensa un ASIC para un solo LLM?
Taalas afirma alcanzar 17.000 tokens/s con Llama 3.1 8B grabado en silicio. Analizamos qué demuestra la prueba, qué omite el entusiasmo y cuándo podría compensar.
¿Qué LLM local puedes ejecutar? Guía de llmfit para tu hardware
llmfit clasifica modelos locales antes de descargarlos. Esta guía explica ajuste, velocidad, calidad, contexto, MoE y cuantización, además de las pruebas que faltan antes de producción.
Miso TTS autoalojado vs API: coste, latencia y VRAM
Miso TTS es expresivo y tiene pesos abiertos, pero los 110 ms corresponden a la API alojada en H100, no a la inferencia local. Compara hardware, precio, licencia y riesgo.
Reduce 16x la memoria de vectores de tu RAG: ¿está lista para producción la cuantización sin datos?
Un nuevo índice Rust reduce 10M embeddings de 31 GB a 4 GB con el TurboQuant sin entrenamiento de Google. Qué prueba el método, dónde gana a FAISS, el compromiso de recall y cómo pilotarlo.
Directorio completo de artículos
- DeepSeek V4 Flash 0731 en un PC de IA: ¿qué funciona?
- Cómo afinar Gemma 4 gratis con Unsloth y Colab
- Taalas HC1 a examen: ¿compensa un ASIC para un solo LLM?
- ¿Qué LLM local puedes ejecutar? Guía de llmfit para tu hardware
- Miso TTS autoalojado vs API: coste, latencia y VRAM
- Reduce 16x la memoria de vectores de tu RAG: ¿está lista para producción la cuantización sin datos?
- Una caché KV compartida redujo 14x la latencia de inferencia de un LLM, sin GPUs nuevas
- Compresión LLM sin Pérdida vs 8-bit GGUF: ¿Qué Está Listo?
- Review de Cisco Antares: Triage Local de Vulnerabilidades sin Cloud
- NVIDIA Nemotron 3.5 ASR: ¿Está listo el STT self-hosted para voice agents?
- Kimi K3 para Empresas de la UE: Coste API, Datos y Plan de Piloto
- Mesh LLM: ¿Puede un LLM Ejecutarse en Varios Ordenadores?
- Review de Bonsai 27B: ¿Puede un LLM de 27B Ejecutarse en un Móvil?
- Soofi S: ¿Está listo para empresas el LLM soberano de Alemania?
- Colibri Ejecuta GLM-5.2 en Hardware de Consumo. Esta Es la Trampa.
- Cuándo los Modelos Locales Superan a las APIs: Calculadora Break-Even para Empresas de la UE
- Calculadora de Costes LLM 2026: Coste por Tarea, No por Token
- Renderizar tu prompt como imagen para recortar el coste de LLM un 60%: ¿genialidad o absurdo?
- Más barato por token. Más caro por respuesta.
- Dario Le Declaró la Guerra al Código Abierto. La Guerra Real Es Por Tu Factura de IA.
- Gateways LLM Comparados 2026: LiteLLM vs OpenRouter vs Portkey vs RouteLLM
- Alojar LLMs en la UE: Cuándo Salen a Cuenta los Open Weights
- Duelo de LLM de Pesos Abiertos 2026: DeepSeek vs Qwen vs Kimi vs GLM vs Llama
- Cómo Reducir los Costes de Tokens LLM en 2026
- ¿Cuándo vale la pena construir un eval de LLM? Coste, ROI y confiar en el juez
- ¿RAG, fine-tuning o contexto largo? Comparativa 2026
- Costes de APIs LLM 2026. Cambio de Arquitectura