En este artículo
Feynman: análisis del agente de investigación IA open source
Feynman es uno de los intentos open source más completos de convertir deep research en un workflow auditable desde terminal. Escribe un tema y el sistema puede buscar papers, webs y repositorios, repartir tareas entre cuatro agentes, redactar un informe con fuentes, comprobar citas, comparar un paper con su código, planificar una replicación y vigilar novedades.
Nuestro veredicto tras revisar el código y la documentación públicos el 3 de septiembre de 2026: Feynman merece un piloto en equipos de investigación técnica, pero “totalmente local” describe una configuración posible, no todos los workflows. Las llamadas al modelo, los buscadores y las GPU en cloud pueden sacar datos de tu entorno y generar costes. La verificación de citas reduce un fallo peligroso, pero no sustituye a quien debe juzgar si la evidencia es suficiente.
Esta página responde a la intención específica “análisis de Feynman” y “agente de investigación IA open source”. Nuestro análisis de LangChain Deep Agents cubre un harness general, Agent Reach cubre acceso económico a fuentes y LLM-as-a-Verifier cubre scoring de trayectorias. Separar estos trabajos evita canibalizar guías de arquitectura más amplias.
¿Quieres convertir una demo de investigación en un workflow controlado para tu equipo?
Revisar la arquitectura de investigación IA¿Qué es Feynman?
Feynman es una CLI research-first con licencia MIT construida sobre la runtime Pi y alphaXiv. El README oficial documenta deep research, revisión bibliográfica, ranking de papers, redacción, peer review, auditoría de código, replicación, recetas ML y watches recurrentes. Los resultados se escriben en carpetas locales y los workflows intensivos en fuentes generan artefactos de procedencia.
| Agente | Trabajo principal | Decisión que sigue siendo humana |
|---|---|---|
| Researcher | Encontrar papers, webs, repositorios, datasets y prior art | Si el espacio de búsqueda y los criterios de exclusión son adecuados |
| Reviewer | Criticar borradores y graduar la severidad de cada problema | Si el estándar corresponde al campo y a la decisión |
| Writer | Convertir notas y evidencias en informes estructurados | Si el framing, la incertidumbre y la recomendación son defendibles |
| Verifier | Comprobar URLs, soporte de citas y claims entre paper y código | Si la fuente y la evidencia tienen calidad suficiente |
Importa más el proceso que el número de agentes. Feynman guarda planes, investigación intermedia, borradores, notas de verificación y resultados finales como archivos. Esto crea puntos de entrega revisables y permite recuperar runs largos. También obliga a aplicar controles de acceso, retención y backup a las notas sensibles.
¿Cómo funciona Feynman deep research?
El proyecto no lanza un swarm sin más. Su workflow de deep research escribe primero un plan y espera aprobación. Las preguntas estrechas permanecen en el agente principal; los estudios amplios pueden delegar búsquedas paralelas. Después extrae hallazgos, separa consenso y desacuerdo, y verifica cada claim contra sus fuentes.
- Planificar la pregunta. Subpreguntas, estrategia de fuentes, tareas y verificación quedan visibles antes del gasto.
- Elegir la escala. Mantén una pregunta estrecha en un agente o paraleliza un mapa de evidencia amplio.
- Extraer, no solo resumir. Captura métodos, resultados, limitaciones y ubicación de los claims.
- Sintetizar conflictos. No fuerces una respuesta limpia cuando la literatura discrepa.
- Verificar antes de entregar. Reabre fuentes y elimina o marca afirmaciones sin respaldo.
La aprobación del plan es una buena decisión de producto. Hace visible el alcance antes de la fase cara. La calidad sigue dependiendo del prompt, el modelo, la cobertura del retrieval y la persona que aprueba.
¿Qué puede hacer además de una revisión bibliográfica?
| Workflow | Decisión que ayuda a tomar | Límite |
|---|---|---|
deepresearch | Crear un informe desde papers, web y código | No garantiza cobertura completa |
lit y rank | Mapear un campo y priorizar lecturas | El ranking incorpora juicios |
audit | Comparar claims de un paper con código público | No ve implementación privada |
replicate | Convertir un claim en pasos, supuestos y criterios de éxito | Ejecutar exige elegir entorno |
watch | Seguir papers, releases y evidencia nueva | Solo es recurrente con scheduler disponible |
recipe y autoresearch | Traducir investigación a experimentos ML | Compute, derechos y evaluación siguen siendo tuyos |
¿Feynman funciona realmente en local?
Puede usar inferencia local, pero la investigación habitual sigue consultando fuentes externas. La documentación del instalador standalone describe un bundle con Node.js fijado y verificación SHA-256 antes de reemplazar una instalación. También existe npm. Un equipo sensible a supply chain debe inspeccionar el script, fijar una release y validar el checksum publicado.
La guía de configuración admite proveedores alojados, Amazon Bedrock, LM Studio, LiteLLM, Ollama y vLLM. Un modelo local puede mantener prompts e inferencia en tu infraestructura. Búsqueda de papers, retrieval web, alphaXiv, parsers y compute cloud siguen cruzando la red salvo que los reemplaces o desactives.
- ¿Adónde va el prompt de investigación?
- ¿Qué proveedor recibe URLs, documentos, repositorios o consultas?
- ¿Qué contenido se guarda en caché y durante cuánto tiempo?
- ¿Dónde quedan credenciales y tokens OAuth?
- ¿Sale telemetría del dispositivo y la permite tu política?
“Se ejecuta desde el terminal” habla de interfaz. “Todos los datos permanecen en local” habla de arquitectura. Verifica la segunda afirmación con tu configuración exacta.
¿Elimina las citas inventadas?
No, pero crea una frontera mejor que un texto con apariencia académica y sin comprobación. El Verifier debe abrir cada URL, localizar el pasaje, clasificar el claim como respaldado, exagerado, contradicho o sin soporte, y quitar lo que no puede justificar.
Tres límites permanecen: una URL viva puede contener mala evidencia, el modelo puede omitir un defecto metodológico y la búsqueda puede perder el paper decisivo. Trata el informe como un borrador auditable. Nuestra checklist de evaluación y sandbox para agentes IA añade pruebas deterministas, casos adversariales y aprobación humana.
¿Puede auditar y replicar papers?
El workflow de auditoría de código extrae claims concretos del paper y busca la configuración, entrenamiento y evaluación correspondientes en su repositorio público. Documenta diferencias, implementaciones ausentes y riesgos de reproducibilidad con rutas de archivo. No puede ver código privado, datos ausentes ni decisiones del operador que no se documentaron.
El workflow de replicación prepara requisitos, receta experimental, detalles no especificados, riesgos y criterios de éxito. Solo ejecuta después de elegir local, aislado, Docker, Modal, RunPod o solo plan. Ese gate importa porque una replicación puede descargar código no confiable, procesar datos con licencia y consumir presupuesto GPU.
Usa la palabra “replicado” únicamente cuando hayan pasado los checks con scripts y resultados raw conservados. Un plan plausible no es una reproducción.
¿Los watches son automáticos?
Solo cuando existe capacidad real de scheduling. La documentación de watch dice que Feynman siempre crea una baseline y un plan de seguimiento, pero solo programa recurrencia si ve la herramienta de scheduling. En caso contrario registra la carencia y entrega un prompt de refresco.
¿Cuánto cuesta Feynman?
El software tiene licencia MIT, así que no cobra licencia. El coste de un informe aceptado incluye al menos cinco partidas:
- Inferencia: agente principal, investigadores, reviewer, writer y verifier consumen tokens o compute local.
- Búsqueda y extracción: proveedores alojados pueden cobrar por consulta, documento o grounding.
- Compute experimental: GPU local, minutos cloud, almacenamiento y transferencia.
- Revisión humana: una persona experta resuelve evidencia incierta y recomendaciones arriesgadas.
- Operación: versiones, credenciales, retención, monitorización, fallos y cambios de proveedor.
Mide coste por informe aceptado o experimento verificado. Un documento barato que exige dos horas senior de reparación es caro.
¿Para qué equipos encaja?
| Equipo | Encaje | Motivo |
|---|---|---|
| ML o I+D que revisa papers y código | Piloto fuerte | Audit, ranking, replicación y procedencia encajan |
| Due diligence técnica | Piloto fuerte | Informes con fuentes y checks de código crean evidencia revisable |
| Producto en un campo técnico rápido | Buen encaje con operación | Watches y workflows reducen trabajo repetido |
| Estudiante con un resumen puntual | Puede sobrar | Terminal, proveedores y revisión añaden fricción |
| Equipo regulado que espera aprobación autónoma | Mal encaje sin controles | Gobierno y validación siguen siendo humanos |
Un piloto de Feynman de dos semanas
- Elige una pregunta repetible. Usa un tema con un informe humano fiable y fuentes obligatorias conocidas.
- Congela la rúbrica. Mide recall, fuentes irrelevantes, soporte de claims, correcciones y tiempo de aprobación.
- Fija release y modelo. Registra versión, modelo, ruta de búsqueda, prompts y fecha.
- Empieza sin ejecutar experimentos. Valida investigación y citas antes de conceder acceso a código o GPU.
- Incluye un caso adversarial. Usa papers contradictorios, un enlace muerto, código incompleto y un claim atractivo sin fuente.
- Mapea el flujo de datos. Documenta proveedores, credenciales, cachés, retención y requests.
- Prueba una auditoría. Un ingeniero valida una muestra directamente en el repositorio.
- Prueba un plan de replicación. Una persona experta revisa supuestos antes de gastar compute.
- Cuenta el coste total. Tokens, búsqueda, GPU, fallos y minutos de revisión.
- Define el gate de adopción. Amplía solo si mejora tiempo o cobertura sin reducir soporte y control.
De demo de investigación a workflow IA controlado
¿Quieres evaluar Feynman con tus fuentes, proveedores y límites de riesgo? Wavect diseña el piloto, mide calidad y coste, y endurece el workflow que demuestre valor.
Ruta de servicio:
Preguntas frecuentes
¿Qué es Feynman AI?
¿Feynman es open source y gratis?
¿Puede funcionar completamente en local?
¿Feynman verifica todas las citas?
¿Puede ejecutar experimentos en GPU?
¿Está listo para investigación empresarial?
Límite de esta investigación
Estado comprobado el 3 de septiembre de 2026 contra el repositorio, licencia y documentación oficial. Este es un análisis independiente para compradores, no un post patrocinado, una auditoría de seguridad ni un benchmark controlado. No instalamos Feynman, no enviamos documentos privados, no conectamos proveedores de pago ni ejecutamos una replicación GPU. Fija una release y vuelve a revisar la documentación antes de adoptarlo.
Reflexiones finales
La mejor idea de Feynman no es que cuatro agentes escriban un informe. Es que la investigación deje una cadena visible desde el plan y las fuentes hasta la síntesis, la verificación y los artefactos experimentales. Un equipo técnico puede revisar esa cadena en lugar de decidir si la prosa parece convincente.
La decisión de compra es condicional. Pilota Feynman cuando la investigación técnica repetida sea cara y la procedencia importe. Mantén a personas responsables del alcance, la evidencia y la aprobación. Llama al sistema local solo después de mapear todo el flujo de datos. Evalúalo por resultados aceptados, soporte de citas, reproducibilidad y coste total de revisión.
