2026-05-14 大模型一周新闻

一周结论

2026-05-08 到 2026-05-14 这一周,Agent 安全成为重点。METR 的长任务评估和 JAW 对 agentic workflow 的攻击研究,都指向同一件事:Agent 越能做事,越需要权限边界。

重点新闻

METR:长任务时间跨度成为前沿模型评估指标

  • METR 的 task-completion time horizon 继续被用来衡量模型能稳定完成多长的人类任务。
  • 这类评估比传统 benchmark 更贴近 Coding Agent、研究 Agent、企业自动化场景。

参考:

研究:JAW 揭示 Agentic Workflow 可被输入劫持

  • 论文《Comment and Control》研究 GitHub Actions、n8n 等自动化平台中的 LLM Agent 被 issue comment 等输入操纵的风险。
  • 论文称攻击可能导致凭据泄露或非预期命令执行,并涉及 Claude Code、Gemini CLI、Qwen CLI、Cursor CLI 等工具链。

风险

对企业来说,Agent 不只是“调用模型”,还会读取仓库、运行命令、访问密钥和提交代码。任何来自 issue、PR、工单、聊天记录的上下文都可能成为攻击面。

参考:

后续跟踪

  • Agent 执行权限是否能做到最小化。
  • CI/CD 中的 AI 审查器是否会读取不可信输入。
  • 企业内部是否需要专门的 Agent 安全基线。