Propuesto Inicio:

Agent Readiness Audit

¿Cómo se audita un agente de IA antes de confiar en él — y se puede enseñar ese proceso en público sobre un prototipo real?

  • Python
  • Claude
  • Markdown

El problema

Los equipos que prueban agentes de IA corren el riesgo de confiar en demos frágiles. Una demo que “parece útil” no responde a las preguntas que importan:

  • ¿Qué fuentes usó y se pueden verificar?
  • ¿Qué herramientas llamó y por qué?
  • ¿Cuánto contexto (y dinero) desperdició?
  • ¿Qué fallos puede repetir de forma silenciosa?
  • ¿Qué acciones deberían requerir aprobación humana?
  • ¿Cómo se verifica el resultado sin releerlo todo a mano?

Hoy esto se resuelve con intuición, prompts largos y revisión manual poco estructurada.

Hipótesis

Creo que builders, pymes técnicas y responsables de automatización que ya experimentan con agentes aceptarán feedback y conversación si publico un teardown práctico que evalúe logs, contexto, tools, evals, coste y gates humanos sobre un prototipo mínimo.

El prototipo elegido

Mini agente de research de señales de mercado: un workflow mínimo (inicialmente manual o semiautomático) que toma un tema o URL y produce una ficha de señal con fuentes consultadas, evidencia usada, frescura del dato, limitaciones de acceso, resumen del insight y siguiente acción sugerida — más un log de ejecución.

No se busca automatizarlo todo. El objetivo es tener un objeto pequeño sobre el que aplicar la auditoría de punta a punta.

Dentro del alcance v0

  • 1 workflow local pequeño o manual guiado.
  • 3–5 fuentes públicas como prueba.
  • 1 salida en markdown y 1 log estructurado por ejecución.
  • 1 checklist de readiness aplicada y 1 teardown público derivado.

Fuera del alcance

Plataformas multiagente, interfaces, scraping agresivo, datos privados y cualquier promesa de producción.

El log mínimo por ejecución

Si un agente no puede rellenar esto, no está listo para que nadie confíe en él:

run:
  goal:               # qué se le pidió
  inputs:             # con qué partió
  sources_checked:    # qué fuentes abrió
  tools_used:         # qué herramientas llamó
  evidence_used:      # qué evidencia sustenta el output
  blocked_or_uncertain: # qué no pudo verificar
  output_file:        # dónde está el resultado
  verification:       # cómo se comprobó
  next_action:        # qué propone hacer después

Evaluación mínima

  1. ¿Las fuentes existen y se pueden abrir?
  2. ¿La fecha y frescura del dato están claras?
  3. ¿El output separa evidencia de interpretación?
  4. ¿El agente declara sus limitaciones y bloqueos?
  5. ¿El coste de contexto es razonable para el tamaño de la tarea?
  6. ¿Las acciones sensibles requieren aprobación humana?

Criterios definidos antes de empezar

Éxito mínimo: checklist completada sobre un prototipo real, al menos 1 gap concreto detectado y corregido, artefacto público listo.

Éxito fuerte: una persona técnica guarda el artefacto, lo comenta, pide la checklist o acepta una conversación.

Fallo: el prototipo se convierte en construcción técnica grande antes de publicar; la auditoría no produce aprendizajes accionables; el resultado se queda en nota interna.

Estado actual

Propuesto. El artefacto público previsto: “Cómo auditaría un agente de investigación antes de confiar en él”.