Generado por
python scripts/generate_papers.py. Tu bitácora personal va enBITACORA.md.
Paper: AgentBench: Evaluating LLMs as Agents (2023)
Nivel: L3 · Notebook: P117_agentops.ipynb
Evalúa agentes en ocho entornos distintos y hace visible que la tasa agregada esconde dónde y cómo fallan.
- Lee la pasada 1 de la ficha: título, resumen, figuras. 10 minutos, sin fórmulas.
- Responde por escrito: ¿qué problema resolvía? Compáralo con: «Los agentes se anunciaban con una cifra global de éxito. Esa cifra no dice en qué entornos sirven, en qué paso se pierden ni por qué modo fallan, que es exactamente lo que hace falta para operarlos y para decidir qué arreglar.»
- Abre el notebook y escribe tu predicción (sección 7) antes de ejecutar nada.
- Ejecuta y contrasta. Si acertaste, explica por qué; si fallaste, explica qué supusiste mal.
- Haz el anti-patrón (sección 11) y su corrección. Es la parte que más se evalúa.
- Escribe una limitación de la miniatura y una del paper. No las copies de la ficha.
- Sé qué se hacía antes de este paper y por qué no bastaba.
- Puedo dibujar el mecanismo sin mirar.
- Ejecuté la miniatura e interpreté su salida sin repetir el texto de la ficha.
- Sé nombrar una cosa que el paper no demostró.
- Sé qué idea de las que suelen atribuírsele llegó en realidad después.
- Puedo conectar este hito con el siguiente en una frase.
AgentOpstrayectoriasmodos de falloevaluación multi-entornoagentes