AI Agent 期刊

历史存档 · 共 99 期

今日刊 →
99
归档期数
10
分页
10
每页期数
2026-09-09 周三

HarvestBench: Measuring Whether LLM Agents Will Pay to Avoid Killing Animals

智能体在实现目标的过程中造成的副作用的基准已经存在,但HarvestBench是第一个对避免副作用定价并将该副作用命名为生物的基准。这是一个农场模拟: LLM子代理与田间动物一起驾驶两辆拖拉机通过合作玉米收获。

18
2026-09-04 周五

HarnessDev: Can LLMs Create and Evolve Their Own Agent Harness?

随着代理从研究原型转向部署工具,他们的能力越来越依赖于模型-外部执行基础设施,通常称为代理线束。在保持模型权重固定的同时更改此线束可以大大改变任务性能。

19
2026-09-03 周四

RealSWE: A Compositional Evaluation of Coding Agents under Realistic User Requests

编码代理现在通常在SWE-bench系列基准上进行评估,其任务是根据精心策划的GitHub问题构建的:长、结构化和信息丰富。然而,真正的用户请求通常要短得多,结构化程度也较低。

18
2026-09-02 周三

Super Library Agent: Joint Generation and Maintenance of Multiple Applications Beyond the Single Codebase

组织通常开发和维护相关应用程序的组合:共享大量领域逻辑、接口模式或操作约定的可独立部署的代码库。随着LLM编码代理越来越多地用于生成和维护此类软件,朴素的逐个应用程序工作流程跨代码库复制共享逻辑,并允许长时间的代理维护以积累冗余、死代码和结构侵蚀。

20
2026-09-01 周二

SwarmBench: Can Large Language Models Act as Agent Swarm Orchestrators?

【arXiv】基于大型语言模型的多Agent系统正在从固定的交互拓扑演变为动态编排的Agent Swarms。但是,现有的基准仍然主要基于单代理或通用代理任务,因此

21
2026-08-31 周一

Code as Worlds: Agentic Discovery of Executable World Representations for Physical Reasoning

物理理解和推理依赖于形成世界的紧凑和可概括的表示。虽然现代视觉语言模型可以识别和解释不同的物理事件,但它们通常缺乏对潜在机制的明确表示,例如对象状态、物理参数和管理动态,这对于可靠地推理世界如何演变和对干预措施的反应是必需的。

18
2026-08-28 周五

What Makes Good Agentic Data? An ACE Lens on Data Generation for LLM Agents

LLM代理越来越依赖于生成的交互数据来学习如何与外部环境交互。这项工作开发了一个两级框架,将代理数据表示为通用分解对象(环境、任务、交互、验证器) ,并通过精度复杂度分割( ACE )透镜将生成公式化为约束分布设计。

20
2026-08-27 周四

Autonomous Mathematical Discovery in an Open-World Multi-Agent Environment

我们研究空间站中的自主数学发现,空间站是一个开放世界的多智能体环境,其中来自不同模型家族的人工智能智能体在没有中央协调员或脚本管道的情况下追求共同的研究目标。代理商选择自己的研究方向,进行实验,合作,构建共享的科学文献。

18
2026-08-26 周三

LongRCA Bench: Diagnosing Responsible Roles and Root Causes in Long-Horizon Agent Failures

当长期客服代表执行失败时,结果级评估会显示不成功的结果,但不会显示决定性错误进入轨迹的位置。然后,开发人员必须检查完整的执行情况,以确定责任角色,并本地化最早的决定性根本原因步骤。

18
2026-08-25 周二

SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science?

软件越来越多地作为科学仪器本身的一部分发挥作用,使得科学代码的失败不仅会影响程序行为,还会影响科学结论背后的证据。然而,对编码代理的现有评估在很大程度上强调了聚合任务的成功,对代理在修复科学软件时失败的原因提供了有限的见解。

18