微软公开 30 万条 Copilot Agent 运行轨迹:AI 编程第一次有了"体检报告"
微软 Azure Research 在 10 月 1 日公开了 30 万个 Copilot coding agent 真实会话的运行轨迹:930 万次模型调用、870 万次工具调用,全部脱敏。这是 AI 编程第一次拥有生产级 workload 数据——缓存、重试、空闲调度的账,终于能算清楚了。

10 月 1 日,微软 Azure Research 做了一件对 AI 编程社区意义重大的事:公开了 301,026 个 GitHub Copilot coding agent 真实会话的运行轨迹(trace)。这批数据覆盖 2026 年 6 月 1 日至 7 日、来自非企业版 Copilot 用户的均匀采样,包含 930 万次大模型调用和 870 万次工具调用,全部经过脱敏,以 CC-BY 协议发布在微软的 AzurePublicDataset 仓库中,并附带可复现论文图表的 notebook。
消息由论文合著者、Azure Research 工程师 Haoran Qiu 在 X 上公布,论文第一作者 Banruo Liu 在微软 Azure Research 实习期间完成了这项研究,论文已发布在 arXiv 上。需要区分的是:公开的数据集是"切片",完整研究规模更大——论文描述的生产级研究覆盖 320 万用户、1300 万会话、7.61 亿次 LLM 调用和 95 万亿 token,数据来自 VS Code 与 Visual Studio 中的 Copilot coding agent。
Agent 的工作方式,第一次被量化
论文的核心发现是关于基础设施的,而非模型能力。一个开发者的请求会触发一连串模型调用与工具动作:搜文件、改代码、跑测试、根据测试结果继续迭代。在完整研究中,LLM 调用与工具调用几乎是一比一的关系,87% 的调用由 agent 主动发起,而非用户直接触发。
这个模式动摇了很多现有系统的设计假设。几个关键数字值得所有做 AI 工具的人记住:
- 缓存命中有断崖:同一轮对话内缓存命中率约 90%,跨轮掉到 55%,切换模型后更低。Prompt caching 不是"开了就行",跨轮上下文管理才是省钱的关键。
- 工具失败的代价很高:9% 的轮次中出现工具失败,触发的重试最多让算力消耗翻 4 倍。Agent 的"试错"是隐形成本大户。
- 空闲时间可以回收:研究者提出的 idle-time predictor 在评估中捕获了 86%–90% 的总空闲时间——开发者在读结果、思考的间隙,系统本可以释放资源,而不是为每一次模型调用都按孤立请求调度。
它公布了什么,又刻意没公布什么
数据集记录的是元数据:时间、token 数量、缓存行为、匿名化的模型标签、工具调用序列。它明确排除了:prompt、模型回复、源代码、文件路径、仓库名、用户与组织标识。用论文作者的话说,外界可以检查 agent 如何消耗资源,但看不到开发者让它做了什么、它做出了什么。
这个边界划得很聪明:既给了基础设施研究者真实生产数据,又守住了代码隐私。对学术界和独立工具开发者来说,这是以前拿不到的东西——过去讨论 coding agent 全靠 benchmark 分数和体感,现在终于有 workload 层面的 ground truth。
我们的判断:AI 编程从"玄学"走向"工程学"
这件事的象征意义大于数据本身。过去一年,AI 编程的讨论停留在两个极端:要么是 benchmark 榜单上的数字游戏,要么是"我感觉 Claude Code 比上周变笨了"的体感玄学。微软这次公开的,是生产环境里 agent 真实干活的"体检报告":它怎么花 token、哪里在浪费、瓶颈到底在模型还是在调度。
对三类人有直接价值:
- 做 AI 编程工具的人:缓存策略、重试退避、会话级调度,这三笔账现在有真实数据可算了。特别是"工具失败→重试→4 倍算力"这条,值得写进每个 agent 框架的默认配置里。
- 花钱用 agent 的团队:87% 的调用是 agent 自主发起的——你的账单里,大头不是你打的那几行 prompt,是 agent 背着你跑的那几十轮循环。成本治理要从"管 prompt"转向"管循环"。
- 研究者:37 个匿名模型标签、118 万用户轮次、6314 亿 prompt token,这是研究"agent 行为模式"而非"模型能力"的罕见材料。
但也要泼一盆冷水:这只是一个产品(Copilot)、一类用户(非企业版)、一周时间(6 月初)的切片。它回答不了"Claude Code 和 Codex 谁更强",也代表不了企业级 workload。拿它做基础设施研究很合适,拿它当行业结论就过界了。
一个值得玩味的细节:微软选择公开的时机,恰好是各家 agent 拼"终端大战"的 10 月。当所有人都在比谁的 agent 更 autonomous 时,微软把"autonomy 到底有多贵"摊开给大家看。这或许是 2026 年下半场 AI 编程竞争的新维度:不只比谁更强,还要比谁更不浪费。
原始来源:RuntimeWire《Microsoft releases 301,000 Copilot agent traces for researchers》(2026-10-01),一手信息来自 Haoran Qiu 的 X 公布、AzurePublicDataset 仓库与 arXiv 论文。
原始来源
相关文章

Gergely Orosz 走访 OpenAI、Anthropic、Cursor、Ramp 后写下的 2026 行业现状:近 100% 代码由 AI 生成、Agent PR 八个月涨近 10 倍、code review 沦为表演、IDE 被判为遗产产品。本文提炼报告要点,并给出 vibe coder 的三个判断与四件本周可做的事。

2026 年 10 月 7 日,Google Developers 发布 Developer Knowledge API 生态:Google Cloud、Firebase、Android 等官方文档变成程序化事实来源,配 gcloud CLI 入口、官方 Agent Skill(一行安装)、MCP server 和多语言客户端库。为什么「文档 API 化」能连根拔掉 vibe coding「模型记错 API」的经典翻车。

2026 年 10 月 8 日,Google Cloud 在 Gemini at Work 2026 大会上发布 Gemini agent:为工作而生的统一 Agent,拿目标自己规划、按任务在 Gemini 和 Claude 模型之间自动选择,并推出拥有独立邮箱、calendar 和通讯录席位的「同事 Agent」。四点判断:Agent 竞赛的下半场是「更像同事的 Agent」。