一、WorkBuddy 月活 658 万,办公 Agent 三强格局初显 9 月 6 日,QuestMobile 发布《2026 年 AI 平台发展研究报告》,给出截至 2026 年 7 月的办公 Agent 数据。腾讯旗下 WorkBuddy 月活 658.2 万,PC 客户端月人均使用 19.0 次,包揽规模与频次双榜第一;同属腾讯的 QClaw 以 225.9 万月活排第二,抖音 TRAE Work 190.4 万第三,阿里 QoderWork 23.0 万。 AI 效率办公赛道自 2026 年 7 月合计月活高达 1.02 亿(同比 +8.2%),PC 客户端规模同比暴涨 340.6%,远超 AI 原生 App 的 261.1%。路径越短、越嵌入工作流,粘性越强——用户愿意下载专门客户端,说明办公 Agent 开始从"玩具"变成"生产力底座"。
二、阿里 Qwen3.8-Max 登顶全球编程榜 9 月 2 日,阿里更新旗舰模型 Qwen3.8-Max-0902。在聚焦前端编程能力的第三方榜单 CodeArena 中,得分提升 22 分至 1691 分,位居总榜第一,领先 Claude Opus5、Kimi K3 等模型。它是阿里千问迄今最强模型,总参数 2.4 万亿,支持 100 万上下文 Tokens,更适合企业复杂任务、科研和长周期项目。 成本侧,CodeArena 同步的性价比榜(帕累托前沿)显示其每百万 Tokens 综合平均约 5 美元。新模型已上线千问 AI 平台对外提供 API,千问办公、Qoder、千问 App 均第一时间接入。对开发者来说,这意味着中文语境里的"写代码搭子"第一次在客观榜单上压过海外闭源旗舰——不是情怀分,是跑分。
三、原厂涨价:模型成本压力浮出水面 9 月 5 日,21 世纪经济报道指出一个矛盾现象:原厂在涨,第三方托管却在降。DeepSeek V4-Pro 于 8 月 17 日生效新价,高峰输出 27 元/百万 tokens(旧价约 4.5 倍)、缓存命中 0.30 元(旧价约 12 倍);智谱 GLM Coding Plan 三档月费上涨 130%–261%。但同一时期 OpenRouter 上 DeepSeek V4-Flash 最低报价仅官方低谷价约 1/4,GLM-5.3 Flash 在第三方降幅达 50%。原厂靠订阅生态和许可条款重建定价权,第三方靠规模摊薄抢价格敏感客户。
四、企业选型该看什么 三件事合起来,我们给正在选办公智能体的企业几个建议: 1.看真实使用频次,不看下载量。 月人均 19 次意味着真的嵌进日常流程,比"装机量"更有参考价值。 2.看模型能力和公司场景是否匹配。 要写代码、做工程,Qwen3.8-Max 这类编程后训练的模型值得跟;要办公协同,看它和企业现有系统(钉钉、飞书、企业微信)的打通深度。 3.把成本算进总账。 原厂涨价是趋势,企业要么接受官方价换稳定和服务,要么走第三方托管但要评估合规与稳定性。选之前先估好月均 Tokens 消耗,别等账单来了才发现"省下的人效被模型费吃掉了"。
五、Q&A问答总结 问:办公 Agent 现在哪家最强? 答:按 QuestMobile 2026 年 7 月数据,腾讯 WorkBuddy 在月活和 PC 客户端使用频次上均居第一;但"最强"要看场景——编程类任务 Qwen3.8-Max 在 CodeArena 登顶,协同办公则看与钉钉、飞书等系统的打通深度。
问:国产大模型编程能力真的超过海外闭源了吗? 答:在前端编程(WebDev)这一具体榜单上,Qwen3.8-Max-0902 以 1691 分位居 CodeArena 总榜第一。这是单榜单项领先,不能说全面超越,但对中文开发场景已是可用的强力选项。
问:模型集体涨价,企业怎么办? 答:先测算真实 Tokens 消耗,再用多模型路由——低风险任务用小模型、关键任务才调旗舰,并通过网关统一计量,避免成本失控。也可对比官方与合规第三方托管的价格与稳定性。

