Review de OpenKB: ¿un compilador de conocimiento es mejor que RAG?
OpenKB es una de las implementaciones funcionales más claras de la idea del compilador de conocimiento LLM, pero no sustituye de forma directa al RAG empresarial. Lee las fuentes, redacta resúmenes y páginas de conceptos, actualiza referencias cruzadas y deja que un agente consulte la wiki acumulada. La unidad de trabajo cambia de «encontrar chunks para esta pregunta» a «mantener un cuerpo de conocimiento reutilizable».
El patrón parte del archivo de ideas LLM Wiki que Andrej Karpathy publicó en abril de 2026. La pregunta comercial ya no es si la idea suena bien. Es si OpenKB produce mejores respuestas verificadas que RAG vectorial cuando entran en la cuenta el coste de compilación, la pérdida de información, los permisos y el mantenimiento.
Nuestro veredicto tras revisar el proyecto y la investigación disponible el 11 de agosto de 2026: pilota OpenKB para trabajo con conocimiento curado y mucha síntesis; conserva RAG vectorial o un enfoque híbrido para corpus grandes, cambiantes o sensibles a permisos. Esta página responde a la intención específica «review de OpenKB» y «OpenKB vs RAG». Nuestra guía empresarial de Open Knowledge Format cubre el formato portable. La checklist de preparación de RAG para producción cubre retrieval, permisos y controles de respuesta.
¿Necesitas comparar conocimiento compilado con tu stack actual de retrieval?
Diseñar el piloto de conocimiento¿Qué es OpenKB?
OpenKB es una CLI Python open source con workbench web que compila archivos y URLs en una wiki Markdown persistente y enlazada. El repositorio oficial de OpenKB documenta entradas PDF, Word, PowerPoint, Excel, HTML, CSV, texto, Markdown y URL. La compilación crea o actualiza resúmenes de fuentes, conceptos, entidades, índice y log. Los generadores de query, chat, visualización, slides y agent skills consumen después esa wiki.
| Capa | Qué hace OpenKB | Qué sigue siendo responsabilidad del comprador |
|---|---|---|
| Fuentes sin procesar | Copia o convierte archivos y URLs seleccionados en un workspace de conocimiento | Aprobación, clasificación, retención, borrado y evidencia inmutable |
| Índice de documentos largos | Usa un árbol jerárquico de PageIndex para PDFs de 20 páginas o más | Elección de OCR, aceptación del parser, verificación por página y política de proveedor |
| Wiki compilada | Escribe resúmenes, páginas de conceptos y entidades, enlaces, índice y log | Reglas de esquema, revisión factual, contradicciones y propiedad de la frescura |
| Generadores | Consulta, conversa, visualiza y destila agent skills desde la wiki | Permisos de usuario, UX, evaluación, monitorización y respuesta a incidentes |
Los documentos cortos se convierten con MarkItDown y se leen como texto. Para PDFs largos, OpenKB usa el índice de árbol sin vectores de PageIndex: construye una jerarquía parecida a un índice de contenidos y pide a un LLM que navegue hasta las secciones relevantes. «Sin base de datos vectorial» no significa «sin retrieval». Significa que el retrieval usa estructura documental y razonamiento en vez de similitud entre embeddings.
¿En qué se diferencia un compilador de conocimiento de RAG vectorial?
RAG vectorial suele almacenar chunks y embeddings, recuperar un top-k por pregunta y componer una respuesta. OpenKB mueve más síntesis al ingest. Un documento nuevo puede reescribir varias páginas de conceptos antes de que alguien formule una pregunta.
| Factor de decisión | Compilador OpenKB | RAG vectorial |
|---|---|---|
| Artefacto principal | Wiki Markdown legible y enlazada | Chunks, metadatos e índice vectorial |
| Trabajo al ingerir | Alto: resumir, fusionar, enlazar y revisar conceptos | Normalmente menor: parsear, fragmentar, enriquecer y generar embeddings |
| Trabajo al consultar | Navegar páginas compiladas e índices de fuentes | Generar embedding de la consulta, recuperar chunks y sintetizar |
| Síntesis entre fuentes | Precalculada y acumulada en páginas de conceptos | Se reconstruye por consulta salvo que exista otra capa de resumen o grafo |
| Hecho único | Puede fallar si la compilación omitió el dato | Fuerte cuando el chunk es recuperable y está autorizado |
| Inspección humana | Fuerte: páginas, enlaces y diffs de Git son legibles | Depende de las herramientas de retrieval y de observabilidad del índice |
| Frescura | Requiere recompilación segura y revisión de páginas modificadas | Requiere sincronización, re-embedding y controles contra índices obsoletos |
| Control de acceso | La compilación Markdown no lo resuelve | Puede filtrar ACL de documento o chunk si está bien construido |
| Primer encaje | Investigación curada, due diligence, estándares y conocimiento de dominio | Corpus operativos grandes, soporte, cambios frecuentes y contenido por usuario |
La comparación útil no es «RAG antiguo contra magia nueva». OpenKB combina una wiki compilada con retrieval basado en razonamiento. Un sistema maduro también puede buscar en páginas compiladas, fuentes originales o ambas. La arquitectura es un espectro: chunks, retrieval jerárquico, resúmenes compilados, grafos explícitos y contexto completo cacheado pueden convivir.
¿OpenKB es gratis y cuánto cuesta realmente?
El software usa Apache 2.0, por lo que no cobra licencia de OpenKB para uso comercial. El registro actual del paquete en PyPI mostraba la versión 0.4.4, publicada el 10 de julio de 2026, y clasificaba el proyecto como alpha cuando lo comprobamos. Es una señal de madurez, no una crítica. Compras debe fijar versiones, probar upgrades y presupuestar ownership alrededor de una dependencia que cambia rápido.
El coste total tiene al menos seis partes:
- Tokens de compilación. Cada fuente puede activar resúmenes, conceptos, entidades y referencias cruzadas. Un ingest puede modificar muchas páginas.
- Tokens de retrieval y respuesta. La consulta sigue costando. Sin vectores no significa sin modelo ni sin tokens.
- Procesamiento documental. El parsing local cubre entradas comunes; OCR complejo y PageIndex Cloud opcional añaden otro proveedor y coste.
- Revisión humana. Alguien debe inspeccionar compresión factual, contradicciones, citas y salida sensible.
- Controles empresariales. SSO, roles, límites entre tenants, auditoría, secretos, backups y borrado son trabajo de producto.
- Evaluación y operación. Preguntas doradas, regresión ante cambios, latencia, reintentos, modelos e incidentes necesitan propiedad continua.
La unidad correcta no es «precio por página embebida». Mide coste por respuesta aceptada y respaldada por fuentes, o por tarea de investigación terminada. Incluye compilación, consulta, reintentos y minutos de revisión. Nuestro modelo de coste por acción para agentes de IA aporta ese denominador.
¿El conocimiento compilado supera a RAG en investigación independiente?
Ninguna arquitectura gana todas las tareas de conocimiento. La evidencia reciente más útil es una comparación preregistrada entre RAG vectorial y una wiki compilada por LLM con 24 papers y 13 preguntas. La wiki conectó mejor hallazgos entre papers, y sus páginas citadas respaldaron con mayor frecuencia la afirmación exacta. RAG vectorial cumplió la prueba preregistrada de búsqueda de un solo hecho y usó muchos menos tokens por consulta. Una variante RAG con descomposición recuperó gran parte de la ventaja de síntesis con menos coste, pero no la ventaja de citas por afirmación.
El estudio es deliberadamente pequeño y usa jueces LLM, no humanos. No demuestra que OpenKB supere a un RAG de producción. Sí ofrece a un CTO un modelo de evaluación mejor: puntúa por separado estructura de síntesis, soporte exacto de cada afirmación y coste total. Un promedio único de «calidad de respuesta» oculta el trade-off que necesitas comprar.
Un segundo paper expone el fallo principal. WiCER evaluó compilación de memoria wiki en 6.800 preguntas. La compilación ciega quedó muy por debajo del contexto completo y mostró entre 53% y 60% de fallo catastrófico en la configuración publicada porque descartaba hechos críticos. Un ciclo iterativo de evaluar y refinar recuperó gran parte de la calidad. La lección es directa: la compilación necesita preguntas diagnósticas y pasadas de reparación, no un prompt de resumen de una sola vez.
| Afirmación | Qué respalda la evidencia | Qué no respalda |
|---|---|---|
| Las wikis compiladas ayudan a sintetizar | Ventaja prometedora en conexiones entre papers dentro de un estudio pequeño | Ventaja universal para cualquier corpus, modelo o workload |
| Las wikis compiladas mejoran las citas | Mejor soporte entre afirmación y página citada en ese estudio | Corrección factual automática tras reescribir las fuentes |
| RAG ha quedado obsoleto | Nada en los estudios lo respalda | RAG siguió siendo fuerte en lookup y coste de consulta |
| La compilación puede funcionar sin supervisión | La evaluación iterativa puede reparar pérdida de información | La compilación ciega fue segura para conocimiento crítico |
Ayuda para IA en producción
Si estás construyendo un producto de IA y te preocupan el coste de inferencia, la arquitectura o la preparación para producción, Wavect ayuda a fundadores a convertir prototipos de IA en sistemas fiables.
Ruta de servicio:
¿Qué cambia Google OKF para OpenKB?
La portabilidad es una de las partes más fuertes. Google Cloud presentó en junio de 2026 el Open Knowledge Format v0.1. Estandariza una superficie pequeña de interoperabilidad con Markdown, frontmatter YAML, enlaces, índices y logs. OpenKB afirma que sus páginas están listas para OKF.
Eso importa porque incluso un piloto fallido puede dejar artefactos legibles y versionados. El equipo puede inspeccionarlos en un editor, moverlos con Git o entregarlos a otro buscador o agente. No garantiza corrección semántica, interoperabilidad perfecta ni conformidad permanente si evoluciona v0.1. Valida el bundle en CI y separa las fuentes originales de las páginas compiladas.
¿OpenKB está listo para empresas?
OpenKB está listo para un piloto controlado de desarrollo o investigación. Su superficie pública de control no es una plataforma empresarial completa. El workbench y la API REST facilitan subir, compilar, consultar, conversar, hacer lint y recompilar. El modelo de autenticación documentado sigue siendo local-first.
La guía oficial de la API REST dice que la autenticación está desactivada por defecto y se puede habilitar con un solo bearer token. Advierte expresamente que enlazar el servidor a un host que no sea loopback sin token deja abiertas todas las bases accesibles. Un token compartido puede proteger un endpoint piloto. No equivale a SSO, identidad, roles, autorización por documento ni aislamiento entre tenants.
| Preocupación de producción | Qué aporta OpenKB | Qué falta en empresa |
|---|---|---|
| Autenticación | Bearer token opcional para la API | SSO, ciclo de vida, identidades de servicio y credenciales breves |
| Autorización | Selección de bases por nombre | Permisos por usuario, grupo, tenant, fuente y campo |
| Auditoría | Log de wiki, fuentes y salida apta para Git | Logs ligados a identidad, acciones admin, llamadas de modelo y evidencia de incidentes |
| Protección de datos | Archivos locales y proveedores configurables | Clasificación, cifrado, residencia, retención, borrado y backup |
| Calidad | Linting, resúmenes y respuestas citadas | Golden sets, pruebas adversariales, revisión factual y regresión |
| Escala | Wiki basada en archivos e índice de PDF largo | Capacidad, concurrencia, estrategia de base de datos, colas y recuperación |
Para fuentes sensibles, la autorización durante retrieval es el límite duro. Si un usuario puede leer una política pero no otra, compilar ambas en la misma página de concepto puede filtrar hechos restringidos antes de que la consulta aplique filtros. Crea dominios de compilación que conserven permisos o excluye esas fuentes. Nuestra arquitectura RAG permissions-first explica la misma regla para SharePoint, Confluence y Drive.
¿Cuándo elegir OpenKB, RAG vectorial o un híbrido?
| Necesidad dominante | Punto de partida | Motivo |
|---|---|---|
| Conectar hallazgos en investigación curada | Piloto OpenKB | Las páginas persistentes hacen visible y reutilizable la síntesis |
| Crear conocimiento legible para agentes y personas | OpenKB o workflow nativo OKF | Markdown, enlaces y Git crean un artefacto inspeccionable |
| Buscar millones de registros cambiantes | RAG o plataforma de búsqueda | Indexación incremental y retrieval estrecho son el workload central |
| Aplicar permisos por usuario | RAG con permisos primero | La autorización debe limitar retrieval antes de sintetizar |
| Responder lookup y síntesis entre fuentes | Híbrido | Fuentes originales para hechos y páginas compiladas para relaciones |
| Un manual pequeño y estático | Contexto largo o búsqueda normal | Compiler y vectores pueden añadir mantenimiento innecesario |
No empieces por la tecnología. Empieza por un conjunto etiquetado de preguntas. Si la mayoría pregunta «¿Cuál es el límite actual de reembolso en la política X?», dominan retrieval y permisos. Si pregunta «¿Cómo cambiaron nuestras hipótesis sobre el mercado Y en doce informes?», gana valor la síntesis persistente. Si necesitas ambos, ejecuta ambos caminos y enruta según el tipo de pregunta.
Un piloto OpenKB de diez días
- Elige un dominio con owner. Usa entre 20 y 50 fuentes aprobadas con una persona responsable. No empieces por todo el drive corporativo.
- Conserva la capa de evidencia. Calcula hashes, registra fechas y separa páginas compiladas. La wiki nunca debe sustituir silenciosamente a los originales.
- Crea 30 preguntas ciegas. Incluye hechos, síntesis, contradicciones, ausencias, trampas de permisos y datos recientes.
- Fija tres baselines. Compara búsqueda o trabajo manual, RAG vectorial simple y OpenKB con las mismas fuentes y presupuesto de modelo.
- Puntúa el soporte de cada afirmación. Revisa si cada frase importante está respaldada por la fuente citada, no solo si parece completa.
- Prueba pérdida de información. Recompila tras añadir una fuente contradictoria o actualizada. Comprueba qué cambia, desaparece o sigue accesible.
- Ataca el límite. Prueba prompt injection en documentos, mezcla no autorizada, enlaces maliciosos, archivos enormes, fallos del parser y caída del proveedor.
- Calcula el ciclo completo. Cuenta tokens, p50, p95, reintentos, minutos de revisión, errores y recuperación.
- Define un gate para escalar. Continúa solo si calidad verificada o tiempo de revisión mejoran lo suficiente para pagar controles y operación.
- Mantén una salida reversible. Exporta wiki, esquema, evaluación y manifiesto de fuentes para otro sistema.
El servicio de AI enablement de Wavect puede construir esta comparación en tu infraestructura en lugar de declarar un ganador desde una demo. El caso Twinsoft AI muestra cómo trabajamos trazabilidad y control del revisor. Para el modelo comercial, compara AI enablement con consultoría de IA genérica antes de decidir si necesitas implementación o estrategia.
Preguntas frecuentes
¿Qué es OpenKB?
¿OpenKB es gratis para uso comercial?
¿OpenKB necesita una base vectorial?
¿Puede OpenKB sustituir a RAG?
¿OpenKB está listo para empresas?
¿OpenKB funciona con Codex?
¿Cómo se relaciona OpenKB con Open Knowledge Format?
Límite de la investigación
Estado comprobado el 11 de agosto de 2026. Esta es una review independiente de arquitectura y compra basada en documentación pública e investigación, no un post patrocinado, un pentest ni un benchmark hands-on de un corpus privado. OpenKB, su paquete, API y roadmap pueden cambiar rápido. Fija una versión y verifica la documentación actual antes de comprar.
Reflexiones finales
OpenKB convierte en algo concreto un cambio importante de infraestructura: el conocimiento puede ser un producto mantenido, no contexto temporal de una consulta. Su wiki legible, ruta para documentos largos e integraciones con agentes lo hacen un candidato fuerte para investigación y síntesis.
Los riesgos son igual de concretos. La compilación puede eliminar hechos, el coste de consulta no baja automáticamente y un bearer token local-first no es autorización empresarial. Compara OpenKB con RAG vectorial, puntúa el soporte exacto de afirmaciones, ataca el límite de permisos y conserva intactas las fuentes. Elige OpenKB solo cuando la síntesis acumulada produzca valor medible que pague esos controles.
