Skip to content

Latest commit

 

History

History
44 lines (30 loc) · 2 KB

File metadata and controls

44 lines (30 loc) · 2 KB

🎒 Ficha de estudio — P117 · AgentBench: evaluar modelos de lenguaje como agentes

Generado por python scripts/generate_papers.py. Tu bitácora personal va en BITACORA.md.

Paper: AgentBench: Evaluating LLMs as Agents (2023) Nivel: L3 · Notebook: P117_agentops.ipynb

En una frase

Evalúa agentes en ocho entornos distintos y hace visible que la tasa agregada esconde dónde y cómo fallan.

Ruta de trabajo (en este orden)

  1. Lee la pasada 1 de la ficha: título, resumen, figuras. 10 minutos, sin fórmulas.
  2. Responde por escrito: ¿qué problema resolvía? Compáralo con: «Los agentes se anunciaban con una cifra global de éxito. Esa cifra no dice en qué entornos sirven, en qué paso se pierden ni por qué modo fallan, que es exactamente lo que hace falta para operarlos y para decidir qué arreglar.»
  3. Abre el notebook y escribe tu predicción (sección 7) antes de ejecutar nada.
  4. Ejecuta y contrasta. Si acertaste, explica por qué; si fallaste, explica qué supusiste mal.
  5. Haz el anti-patrón (sección 11) y su corrección. Es la parte que más se evalúa.
  6. Escribe una limitación de la miniatura y una del paper. No las copies de la ficha.

Checklist de «lo entendí»

  • Sé qué se hacía antes de este paper y por qué no bastaba.
  • Puedo dibujar el mecanismo sin mirar.
  • Ejecuté la miniatura e interpreté su salida sin repetir el texto de la ficha.
  • Sé nombrar una cosa que el paper no demostró.
  • Sé qué idea de las que suelen atribuírsele llegó en realidad después.
  • Puedo conectar este hito con el siguiente en una frase.

Conceptos que debes poder definir

  • AgentOps
  • trayectorias
  • modos de fallo
  • evaluación multi-entorno
  • agentes

Fuentes primarias


⬅️ Fichas de estudio · Ficha completa del paper