Volver
Kevin Riedl

15 min de lectura · 11 ago 2026
Última revisión

Siguiente
Se crea en tu dispositivo, sin conectar con Instagram. Copiamos el enlace para su sticker de enlace.

Review de OpenKB: ¿un compilador de conocimiento es mejor que RAG?

OpenKB es una de las implementaciones funcionales más claras de la idea del compilador de conocimiento LLM, pero no sustituye de forma directa al RAG empresarial. Lee las fuentes, redacta resúmenes y páginas de conceptos, actualiza referencias cruzadas y deja que un agente consulte la wiki acumulada. La unidad de trabajo cambia de «encontrar chunks para esta pregunta» a «mantener un cuerpo de conocimiento reutilizable».

El patrón parte del archivo de ideas LLM Wiki que Andrej Karpathy publicó en abril de 2026. La pregunta comercial ya no es si la idea suena bien. Es si OpenKB produce mejores respuestas verificadas que RAG vectorial cuando entran en la cuenta el coste de compilación, la pérdida de información, los permisos y el mantenimiento.

Nuestro veredicto tras revisar el proyecto y la investigación disponible el 11 de agosto de 2026: pilota OpenKB para trabajo con conocimiento curado y mucha síntesis; conserva RAG vectorial o un enfoque híbrido para corpus grandes, cambiantes o sensibles a permisos. Esta página responde a la intención específica «review de OpenKB» y «OpenKB vs RAG». Nuestra guía empresarial de Open Knowledge Format cubre el formato portable. La checklist de preparación de RAG para producción cubre retrieval, permisos y controles de respuesta.

¿Necesitas comparar conocimiento compilado con tu stack actual de retrieval?

 Diseñar el piloto de conocimiento

¿Qué es OpenKB?

OpenKB es una CLI Python open source con workbench web que compila archivos y URLs en una wiki Markdown persistente y enlazada. El repositorio oficial de OpenKB documenta entradas PDF, Word, PowerPoint, Excel, HTML, CSV, texto, Markdown y URL. La compilación crea o actualiza resúmenes de fuentes, conceptos, entidades, índice y log. Los generadores de query, chat, visualización, slides y agent skills consumen después esa wiki.

CapaQué hace OpenKBQué sigue siendo responsabilidad del comprador
Fuentes sin procesarCopia o convierte archivos y URLs seleccionados en un workspace de conocimientoAprobación, clasificación, retención, borrado y evidencia inmutable
Índice de documentos largosUsa un árbol jerárquico de PageIndex para PDFs de 20 páginas o másElección de OCR, aceptación del parser, verificación por página y política de proveedor
Wiki compiladaEscribe resúmenes, páginas de conceptos y entidades, enlaces, índice y logReglas de esquema, revisión factual, contradicciones y propiedad de la frescura
GeneradoresConsulta, conversa, visualiza y destila agent skills desde la wikiPermisos de usuario, UX, evaluación, monitorización y respuesta a incidentes

Los documentos cortos se convierten con MarkItDown y se leen como texto. Para PDFs largos, OpenKB usa el índice de árbol sin vectores de PageIndex: construye una jerarquía parecida a un índice de contenidos y pide a un LLM que navegue hasta las secciones relevantes. «Sin base de datos vectorial» no significa «sin retrieval». Significa que el retrieval usa estructura documental y razonamiento en vez de similitud entre embeddings.

¿En qué se diferencia un compilador de conocimiento de RAG vectorial?

RAG vectorial suele almacenar chunks y embeddings, recuperar un top-k por pregunta y componer una respuesta. OpenKB mueve más síntesis al ingest. Un documento nuevo puede reescribir varias páginas de conceptos antes de que alguien formule una pregunta.

Factor de decisiónCompilador OpenKBRAG vectorial
Artefacto principalWiki Markdown legible y enlazadaChunks, metadatos e índice vectorial
Trabajo al ingerirAlto: resumir, fusionar, enlazar y revisar conceptosNormalmente menor: parsear, fragmentar, enriquecer y generar embeddings
Trabajo al consultarNavegar páginas compiladas e índices de fuentesGenerar embedding de la consulta, recuperar chunks y sintetizar
Síntesis entre fuentesPrecalculada y acumulada en páginas de conceptosSe reconstruye por consulta salvo que exista otra capa de resumen o grafo
Hecho únicoPuede fallar si la compilación omitió el datoFuerte cuando el chunk es recuperable y está autorizado
Inspección humanaFuerte: páginas, enlaces y diffs de Git son legiblesDepende de las herramientas de retrieval y de observabilidad del índice
FrescuraRequiere recompilación segura y revisión de páginas modificadasRequiere sincronización, re-embedding y controles contra índices obsoletos
Control de accesoLa compilación Markdown no lo resuelvePuede filtrar ACL de documento o chunk si está bien construido
Primer encajeInvestigación curada, due diligence, estándares y conocimiento de dominioCorpus operativos grandes, soporte, cambios frecuentes y contenido por usuario

La comparación útil no es «RAG antiguo contra magia nueva». OpenKB combina una wiki compilada con retrieval basado en razonamiento. Un sistema maduro también puede buscar en páginas compiladas, fuentes originales o ambas. La arquitectura es un espectro: chunks, retrieval jerárquico, resúmenes compilados, grafos explícitos y contexto completo cacheado pueden convivir.

¿OpenKB es gratis y cuánto cuesta realmente?

El software usa Apache 2.0, por lo que no cobra licencia de OpenKB para uso comercial. El registro actual del paquete en PyPI mostraba la versión 0.4.4, publicada el 10 de julio de 2026, y clasificaba el proyecto como alpha cuando lo comprobamos. Es una señal de madurez, no una crítica. Compras debe fijar versiones, probar upgrades y presupuestar ownership alrededor de una dependencia que cambia rápido.

El coste total tiene al menos seis partes:

  1. Tokens de compilación. Cada fuente puede activar resúmenes, conceptos, entidades y referencias cruzadas. Un ingest puede modificar muchas páginas.
  2. Tokens de retrieval y respuesta. La consulta sigue costando. Sin vectores no significa sin modelo ni sin tokens.
  3. Procesamiento documental. El parsing local cubre entradas comunes; OCR complejo y PageIndex Cloud opcional añaden otro proveedor y coste.
  4. Revisión humana. Alguien debe inspeccionar compresión factual, contradicciones, citas y salida sensible.
  5. Controles empresariales. SSO, roles, límites entre tenants, auditoría, secretos, backups y borrado son trabajo de producto.
  6. Evaluación y operación. Preguntas doradas, regresión ante cambios, latencia, reintentos, modelos e incidentes necesitan propiedad continua.

La unidad correcta no es «precio por página embebida». Mide coste por respuesta aceptada y respaldada por fuentes, o por tarea de investigación terminada. Incluye compilación, consulta, reintentos y minutos de revisión. Nuestro modelo de coste por acción para agentes de IA aporta ese denominador.

¿El conocimiento compilado supera a RAG en investigación independiente?

Ninguna arquitectura gana todas las tareas de conocimiento. La evidencia reciente más útil es una comparación preregistrada entre RAG vectorial y una wiki compilada por LLM con 24 papers y 13 preguntas. La wiki conectó mejor hallazgos entre papers, y sus páginas citadas respaldaron con mayor frecuencia la afirmación exacta. RAG vectorial cumplió la prueba preregistrada de búsqueda de un solo hecho y usó muchos menos tokens por consulta. Una variante RAG con descomposición recuperó gran parte de la ventaja de síntesis con menos coste, pero no la ventaja de citas por afirmación.

El estudio es deliberadamente pequeño y usa jueces LLM, no humanos. No demuestra que OpenKB supere a un RAG de producción. Sí ofrece a un CTO un modelo de evaluación mejor: puntúa por separado estructura de síntesis, soporte exacto de cada afirmación y coste total. Un promedio único de «calidad de respuesta» oculta el trade-off que necesitas comprar.

Un segundo paper expone el fallo principal. WiCER evaluó compilación de memoria wiki en 6.800 preguntas. La compilación ciega quedó muy por debajo del contexto completo y mostró entre 53% y 60% de fallo catastrófico en la configuración publicada porque descartaba hechos críticos. Un ciclo iterativo de evaluar y refinar recuperó gran parte de la calidad. La lección es directa: la compilación necesita preguntas diagnósticas y pasadas de reparación, no un prompt de resumen de una sola vez.

AfirmaciónQué respalda la evidenciaQué no respalda
Las wikis compiladas ayudan a sintetizarVentaja prometedora en conexiones entre papers dentro de un estudio pequeñoVentaja universal para cualquier corpus, modelo o workload
Las wikis compiladas mejoran las citasMejor soporte entre afirmación y página citada en ese estudioCorrección factual automática tras reescribir las fuentes
RAG ha quedado obsoletoNada en los estudios lo respaldaRAG siguió siendo fuerte en lookup y coste de consulta
La compilación puede funcionar sin supervisiónLa evaluación iterativa puede reparar pérdida de informaciónLa compilación ciega fue segura para conocimiento crítico

Ayuda para IA en producción

Si estás construyendo un producto de IA y te preocupan el coste de inferencia, la arquitectura o la preparación para producción, Wavect ayuda a fundadores a convertir prototipos de IA en sistemas fiables.

Ruta de servicio:

¿Qué cambia Google OKF para OpenKB?

La portabilidad es una de las partes más fuertes. Google Cloud presentó en junio de 2026 el Open Knowledge Format v0.1. Estandariza una superficie pequeña de interoperabilidad con Markdown, frontmatter YAML, enlaces, índices y logs. OpenKB afirma que sus páginas están listas para OKF.

Eso importa porque incluso un piloto fallido puede dejar artefactos legibles y versionados. El equipo puede inspeccionarlos en un editor, moverlos con Git o entregarlos a otro buscador o agente. No garantiza corrección semántica, interoperabilidad perfecta ni conformidad permanente si evoluciona v0.1. Valida el bundle en CI y separa las fuentes originales de las páginas compiladas.

¿OpenKB está listo para empresas?

OpenKB está listo para un piloto controlado de desarrollo o investigación. Su superficie pública de control no es una plataforma empresarial completa. El workbench y la API REST facilitan subir, compilar, consultar, conversar, hacer lint y recompilar. El modelo de autenticación documentado sigue siendo local-first.

La guía oficial de la API REST dice que la autenticación está desactivada por defecto y se puede habilitar con un solo bearer token. Advierte expresamente que enlazar el servidor a un host que no sea loopback sin token deja abiertas todas las bases accesibles. Un token compartido puede proteger un endpoint piloto. No equivale a SSO, identidad, roles, autorización por documento ni aislamiento entre tenants.

Preocupación de producciónQué aporta OpenKBQué falta en empresa
AutenticaciónBearer token opcional para la APISSO, ciclo de vida, identidades de servicio y credenciales breves
AutorizaciónSelección de bases por nombrePermisos por usuario, grupo, tenant, fuente y campo
AuditoríaLog de wiki, fuentes y salida apta para GitLogs ligados a identidad, acciones admin, llamadas de modelo y evidencia de incidentes
Protección de datosArchivos locales y proveedores configurablesClasificación, cifrado, residencia, retención, borrado y backup
CalidadLinting, resúmenes y respuestas citadasGolden sets, pruebas adversariales, revisión factual y regresión
EscalaWiki basada en archivos e índice de PDF largoCapacidad, concurrencia, estrategia de base de datos, colas y recuperación

Para fuentes sensibles, la autorización durante retrieval es el límite duro. Si un usuario puede leer una política pero no otra, compilar ambas en la misma página de concepto puede filtrar hechos restringidos antes de que la consulta aplique filtros. Crea dominios de compilación que conserven permisos o excluye esas fuentes. Nuestra arquitectura RAG permissions-first explica la misma regla para SharePoint, Confluence y Drive.

¿Cuándo elegir OpenKB, RAG vectorial o un híbrido?

Necesidad dominantePunto de partidaMotivo
Conectar hallazgos en investigación curadaPiloto OpenKBLas páginas persistentes hacen visible y reutilizable la síntesis
Crear conocimiento legible para agentes y personasOpenKB o workflow nativo OKFMarkdown, enlaces y Git crean un artefacto inspeccionable
Buscar millones de registros cambiantesRAG o plataforma de búsquedaIndexación incremental y retrieval estrecho son el workload central
Aplicar permisos por usuarioRAG con permisos primeroLa autorización debe limitar retrieval antes de sintetizar
Responder lookup y síntesis entre fuentesHíbridoFuentes originales para hechos y páginas compiladas para relaciones
Un manual pequeño y estáticoContexto largo o búsqueda normalCompiler y vectores pueden añadir mantenimiento innecesario

No empieces por la tecnología. Empieza por un conjunto etiquetado de preguntas. Si la mayoría pregunta «¿Cuál es el límite actual de reembolso en la política X?», dominan retrieval y permisos. Si pregunta «¿Cómo cambiaron nuestras hipótesis sobre el mercado Y en doce informes?», gana valor la síntesis persistente. Si necesitas ambos, ejecuta ambos caminos y enruta según el tipo de pregunta.

Un piloto OpenKB de diez días

  1. Elige un dominio con owner. Usa entre 20 y 50 fuentes aprobadas con una persona responsable. No empieces por todo el drive corporativo.
  2. Conserva la capa de evidencia. Calcula hashes, registra fechas y separa páginas compiladas. La wiki nunca debe sustituir silenciosamente a los originales.
  3. Crea 30 preguntas ciegas. Incluye hechos, síntesis, contradicciones, ausencias, trampas de permisos y datos recientes.
  4. Fija tres baselines. Compara búsqueda o trabajo manual, RAG vectorial simple y OpenKB con las mismas fuentes y presupuesto de modelo.
  5. Puntúa el soporte de cada afirmación. Revisa si cada frase importante está respaldada por la fuente citada, no solo si parece completa.
  6. Prueba pérdida de información. Recompila tras añadir una fuente contradictoria o actualizada. Comprueba qué cambia, desaparece o sigue accesible.
  7. Ataca el límite. Prueba prompt injection en documentos, mezcla no autorizada, enlaces maliciosos, archivos enormes, fallos del parser y caída del proveedor.
  8. Calcula el ciclo completo. Cuenta tokens, p50, p95, reintentos, minutos de revisión, errores y recuperación.
  9. Define un gate para escalar. Continúa solo si calidad verificada o tiempo de revisión mejoran lo suficiente para pagar controles y operación.
  10. Mantén una salida reversible. Exporta wiki, esquema, evaluación y manifiesto de fuentes para otro sistema.

El servicio de AI enablement de Wavect puede construir esta comparación en tu infraestructura en lugar de declarar un ganador desde una demo. El caso Twinsoft AI muestra cómo trabajamos trazabilidad y control del revisor. Para el modelo comercial, compara AI enablement con consultoría de IA genérica antes de decidir si necesitas implementación o estrategia.

Preguntas frecuentes

¿Qué es OpenKB?
OpenKB es un compilador de conocimiento open source en Python. Convierte archivos y URLs en una wiki Markdown persistente y enlazada, y ofrece generadores de query, chat, visualización y agent skills sobre ella.
¿OpenKB es gratis para uso comercial?
Sí. OpenKB usa la licencia Apache 2.0. No hay coste de licencia, pero llamadas a modelos, procesamiento, hosting, seguridad, evaluación, integración y revisión humana sí forman el coste total.
¿OpenKB necesita una base vectorial?
No. Convierte documentos cortos a texto y usa árboles PageIndex para PDFs largos. El retrieval sigue usando razonamiento LLM y estructura documental, por lo que sin vectores no significa sin retrieval ni sin coste.
¿Puede OpenKB sustituir a RAG?
A veces para un corpus curado y orientado a síntesis, pero no siempre. RAG vectorial es un buen inicio para lookup preciso, corpus cambiantes y permisos por fuente. Un híbrido puede consultar conceptos compilados y evidencia original.
¿OpenKB está listo para empresas?
Es creíble para un piloto controlado. Producción requiere SSO, roles, tenants, permisos de fuente, auditoría, secretos, backups, retención, borrado, pruebas de capacidad y evaluación continua.
¿OpenKB funciona con Codex?
El proyecto incluye un agent skill y documenta una instalación manual mediante symlink para Codex. Conviene revisar el skill, fijar la versión del repositorio y proteger la wiki como material interno.
¿Cómo se relaciona OpenKB con Open Knowledge Format?
OpenKB indica que sus páginas están listas para OKF. OKF es el formato portable Markdown y YAML; OpenKB es un productor y herramienta de consulta. El formato no aporta por sí solo calidad, retrieval, permisos ni gobierno.

Límite de la investigación

Estado comprobado el 11 de agosto de 2026. Esta es una review independiente de arquitectura y compra basada en documentación pública e investigación, no un post patrocinado, un pentest ni un benchmark hands-on de un corpus privado. OpenKB, su paquete, API y roadmap pueden cambiar rápido. Fija una versión y verifica la documentación actual antes de comprar.

Reflexiones finales

OpenKB convierte en algo concreto un cambio importante de infraestructura: el conocimiento puede ser un producto mantenido, no contexto temporal de una consulta. Su wiki legible, ruta para documentos largos e integraciones con agentes lo hacen un candidato fuerte para investigación y síntesis.

Los riesgos son igual de concretos. La compilación puede eliminar hechos, el coste de consulta no baja automáticamente y un bearer token local-first no es autorización empresarial. Compara OpenKB con RAG vectorial, puntúa el soporte exacto de afirmaciones, ataca el límite de permisos y conserva intactas las fuentes. Elige OpenKB solo cuando la síntesis acumulada produzca valor medible que pague esos controles.

Ayuda para IA en producción

Si estás construyendo un producto de IA y te preocupan el coste de inferencia, la arquitectura o la preparación para producción, Wavect ayuda a fundadores a convertir prototipos de IA en sistemas fiables.

Ruta de servicio:

Tu bandeja, sin ruido

Sigue el trabajo que te importa

Recibe un correo breve cuando publiquemos algo nuevo. Sigue todo el blog o solo los temas que te interesan.

¿Qué quieres recibir?
Elige tus temas

Gratis, doble opt-in y sin píxeles de seguimiento.

Volver
Kevin Riedl

15 min de lectura · 11 ago 2026
Última revisión

Siguiente

Recibe nuevos artículos por correo

Un correo breve cuando publicamos. Gratis y sin seguimiento.

Gratis, doble opt-in y sin píxeles de seguimiento.