# 一次模型测评后，我开始重新理解WorkBuddy

> 一个模型最终能交付什么，既取决于它本身的能力，也取决于它被放进了怎样的工作环境。 作者｜徐婷 编辑｜奇博士 Flash 模型越来越像AI世界里的“基本款”。 速度快、价格低，应付日常任务绰绰有余。模型横评也因此有了一个固定套路：给几款模型布置同样的任务，看谁的答案更好，再排个名次…

- 分类：AI硬件
- 作者：奇点编辑部
- 发布时间：2026-10-09
- 原文链接：https://www.qidianyanjiushe.com/article/workbuddy
- 文章 ID：83

---

一个模型最终能交付什么，既取决于它本身的能力，也取决于它被放进了怎样的工作环境。

**作者｜徐婷**

**编辑｜奇博士**

****

Flash 模型越来越像AI世界里的“基本款”。

速度快、价格低，应付日常任务绰绰有余。模型横评也因此有了一个固定套路：给几款模型布置同样的任务，看谁的答案更好，再排个名次。

这次Flash模型测评，一开始也是按照这个既定动作执行的。

我们用DeepSeek-V4.1-Flash、云之声U2-Flash、Qwen-3.8-Flash跑了两项任务：一份手机行业深度研报，一个三消小游戏开发。U2Flash和DeepSeekFlash分别在严谨度和洞察力上表现突出，千问则在研报事实核验和游戏交付上暴露出明显短板。

可是当我们复盘整个测试流程时，突然发现这场测试从一开始就不公平：三个模型并没有在同一个工作环境里运行。

DeepSeek Flash和U2Flash是在WorkBuddy里跑完全程，可以联网检索、读写文件和调用工具；Qwen3.8 Flash 则是在千问 AI 平台的网页体验版里完成的，全程只有一个孤立的对话框。

由于初测时没能在千问办公桌面端里直接调用Qwen3.8 Flash模型，所以我们又补了一轮复测并严格控制变量，用完全相同的任务和材料，在WorkBuddy里重新跑了一遍。

结果出乎意料，初测表现拉垮的Qwen3.8 Flash，复测质量明显提升，第一轮里大量数据错误被重新核验、修正；原本卡住的三消小游戏，也完成了从定位 Bug 、修改代码到实际验证的完整闭环。

同一个模型换个工作环境，交付结果就能出现如此巨大的差异，我们不禁思考，所谓的模型评测，测的到底是什么？是模型本身，还是模型进入工作流之后能交付的实际成果？

**千问模型在自家平台“裸奔”**

这次测评的起点，源于一次失败的接入。

我们原本下载了千问办公桌面版，想直接在里面调用Qwen 3.8 Flash模型，但很快遇到了阻碍。千问办公给出的解释是，具体使用哪个模型由产品的会话配置决定，用户无法在对话中手动切换或指定底层模型，模型是否开放也取决于具体入口和账号、版本。

后来我们退而求其次，转向千问AI平台的网页体验版，找到3.8Flash入口，才开始正式跑任务。

当时看，只是换了个操作入口，事后复盘才意识到，这是整场测试最重要的隐性变量。

先看第一轮。

研报任务其实埋了不少坑。我们给到的五份材料包和八个任务清单，里面有数据张冠李戴、单位错误、时间口径混淆和无信源断言。游戏任务则要求模型把一个三消小游戏做出来。

DeepSeek Flash 

U2Flash

U2Flash 对数据陷阱的处理最细，发现"OPPO 687.2 亿元"与传音控股年报数据撞车后，一路追查到工商主体和统计口径。DeepSeek Flash的长处是独立判断，能提出"芯片分叉"这种有锋芒的观点。

Qwen3.8Flash的问题，集中出现在"新机全景"一节。材料中的真实新机尚未到齐，它便提前交了稿，用训练数据里的旧产品线去填2026 年的新机清单：vivo 被写成 X200 系列，华为则出现 Pura 80、Mate 70 等型号。华为2025年报里的营收、净利润、终端业务数据没有拿准；OPPO 的一组数据也判断错误。

游戏任务暴露的短板更严重，它仅生成了一段纯文本代码，需要手动复制到记事本或编辑器中另存运行。在浏览器中打开后，交付物依然停留在极初级的网页 Demo 阶段，能点开玩，但得分逻辑卡死不动，像一个能跑起来、但没有灵魂的空壳。

Qwen3.8flash网页版

这些表现当然有模型本身的因素，比如用旧有历史知识补齐当下信息缺口，生成后缺乏自检机制等，但首轮测试中的，Qwen3.8Flash没有拿到另外两款模型手里的“武器”。

DeepSeek Flash和U2Flash是在WorkBuddy这样的AI办公产品中运行的。查阅华为年报、IDC 出货量、工商数据时，可以联网检索；遇到材料里的数据陷阱，可以发起交叉验证；报告撰写完成后，能够直接进行本地文件落盘、分章整理并打包输出。

至此，局面陷入尴尬，我们以为自己是在横向对比三款 Flash 模型的技术能力，但实际对比的却是三套截然不同的模型调用与交付方式。

一边是模型接入了具备联网、工具调用、本地读写与自检能力的工作台；另一边是模型能力被局限在单一网页对话框里“裸奔”。交付落差，显然无法简单归咎于“模型智商不济”。

于是我们重置变量，任务不变，材料不变，模型不变，只把Qwen3.8 Flash换进相同的工作环境WorkBuddy里，重跑全程。

结果出乎意料。研报任务中，Qwen Flash几乎复现了此前U2Flash 的工程标准。开篇即输出了一份包含七处排错的凭据清单，且每一处都做了交叉验证。

Qwen Flash复测版

而且还建立了“官方、机构、第三方估算”的三级信源体系，并在文中做了逐条标注。初测里，千问在"新机全景"上出现大面积事实错误；复测后，它不仅完成了八章报告，还主动做了一轮数据排错。

在游戏开发任务中，差异更为悬殊。在网页版里，千问只能给出一个静态的文本代码；而在 WorkBuddy 环境下，当渲染出现 Bug 或积分逻辑卡死时，Qwen Flash能够通过工作台的执行环境重新读取报错日志，完成“定位错误、修改代码、本地重新编译验证”的闭环，最终交付出一个可玩性还不错的小游戏。

模型之所以表现出截然不同的交付上限，是因为它获得了重新查证、重新读取上下文材料、调用环境工具并主动纠错的条件。此前被困在对话框里的能力，在具备完整工作链路之后，被最大化释放出来。

DeepSeek Flash 

U2 Flash

这也让我们重新理解了当下 AI 办公产品的路径分野。

千问办公倾向于将模型能力、应用工具与交互界面融合成一套高度标准化的交付方案。这种“开箱即用”的体验极大降低了使用门槛，却也限制了用户对底层模型的自定义选择权。为了追求前端体验的“绝对统一”，模型在复杂、动态场景下的应变潜力被无形中“封印”了。

反观 WorkBuddy，它不强行绑定单一模型生态，允许用户在同一个工作区内根据任务需求自由挂载 DeepSeek、U2或Qwen，把模型当成“可插拔的算力引擎”，把选择权彻底交还给任务本身，模型在这里更像一种可以随时更换的算力资源，工作台负责把任务、上下文、工具和模型组织起来。

在此路径下，AI 办公产品的核心价值不再取决于“我的模型有多强”，而在于“我能否将最合适的模型，精准无缝地嵌入复杂的真实工作流中”。

**Agent竞争升维**

**从“模型入口”到“任务入口”**

回看这场测试，三次体验对应了三种完全不同的 AI 使用方式，也映射了AI应用演进的三个阶段。

第一阶段是对话式的AI助手，单模型聊天，主要面向个人场景。用户进入厂商预设的套件中，模型、工具和交互逻辑都已被全盘打包。它的本质是提升个人效率的辅助工具，优点是简单，代价是选择权的全面让渡。

第二阶段是可调度的“Agent 工作台”，即从“聊天”走向“完成任务”，实现“多模型”按需挂载与团队协同。此时，AI 进化为具备工具调用能力的 Agent，真正开始执行工作。

模型被剥离掉“产品入口”的光环，“降维”为工作流中的一个可插拔组件。这从根本上改变了"用模型"的逻辑。

过去是“因为我想用千问，所以我打开千问”，现在是“我有一个任务，要把合适的模型调度进我的工作台，”AI应用的竞争从"模型入口"走向"任务入口"。

当然必须承认，工作台无法凭空捏造模型本身不存在的智力，模型的推理上限、事实判断与自检能力依然是硬指标。

千问在部分任务中的“交付结果不及预期”，固然有其模型本体的局限，但缺少联网检索入口、缺乏工程化交付环境的体验版平台形态，也是拖累其表现的硬伤。

模型的差距，被“环境”放大，也被“环境”抹平。当主流模型在底层参数和基础推理上日趋同质化，决定用户体验的胜负手，已从“调用哪家模型”，转向“在怎样的工程环境里调用模型”。

知识密度之外，模型的能力分层也在被工程化程度和交付闭环重新定义。一个能检索、落盘、调试、交付的“环境”，成为模型能力得以释放的大前提。

测试过程中还有个小细节颇具启发，我们通过Ulanzi与WorkBuddy联名的AI 硬件进行了交互与指令输出。硬件的接入，让原本局限在屏幕里的工作流有了一个新的物理节点：AI从网页里的对话框进入桌面工作台，又进一步延伸到了真实的硬件设备。

以往我们讨论AI，习惯问的是“模型在哪里运行”，硬件的加入让我们进一步思考“未来，用户该从哪里唤醒 AI”？

从网页文本框，到桌面级 Agent 工作台，再到软硬一体的物理节点，AI 办公的下半场，不再属于抢占“模型入口”的人，而属于掌控“任务入口”的人。

**AI办公下半场**

**从任务入口到企业AI基础设施**

****

过去我们判断一个 AI 产品好不好用，习惯看两个指标：模型聪不聪明，回答漂不漂亮。但当Agent真正介入实际业务，评价体系已经发生了根本性重塑。

它能不能找到材料？能不能正确调用工具？能不能记住上下文？遇到报错能否自主纠偏？最关键的是，最终交出来的成果，是一个能直接拿去复用的“交付物”，还是一个需要人重新收拾残局的“半成品”？

如果说个人效率工具解决的是员工如何用AI，那么当 AI 办公产品深入到企业场景时，必然要撞上下一道高墙：企业如何管理AI？

这也进入了AI应用演进的下一阶段，即全治理的AI组织，或者叫企业AI基础设施期。

用户从“使用 AI”升维至“管理AI”，实现多模型的统一调度、企业级权限隔离与协同治理。模型被进一步解耦并融入企业组织架构，充当数字员工。这一阶段的硬核诉求不再只是单纯提效，还有精细化控制算力成本与数据安全风险。

成本控制上，企业要思考Token 账单谁来支付？各部门算力额度如何分配？

权限与治理上，谁能调用特定模型？谁能接入核心数据库？AI 在本地操作文件时的安全边界在哪里……

如今这场关于“企业 AI 基础设施”的争夺战，各大巨头均已亮牌。

在刚刚结束的云栖大会上，整合后的千问办公被推至 AI 落地展示的绝对 C 位，不仅加速推进 Personal Agent 战略，更集中发布了“企业上下文”等私有数据管理能力，试图通过深度绑定钉钉生态与云端算力，把 AI 嵌进企业协同的每一个齿轮。

而百度亦在加速整合内部办公 Agent 资源，此前百度搜索、网盘、地图、秒哒和伐谋等产品能力已通过Skill接入百度搭子，7月百度搭子企业版发布后，次月又将 dodo 全面并入“百度搭子”，试图在 B 端办公生态中构筑闭环。

最近，WorkBuddy 企业版也进行了一次大升级，将腾讯文档、腾讯乐享、腾讯网盘、安全与效能运营平台、腾讯 AI 设计智能体 Ardot 等五项办公能力进行套件化整合，且打通了企业 AI 的“身份系统”，目前WorkBuddy 已经具备 SSO 单点登录、组织架构管理、成员用量控制、统一订阅等企业级能力。

从账号、组织架构、Credit 用量，再到 Skill、Agent 和企业数据，企业管理员开始可以在同一套体系里管理这些 AI 资源。WorkBuddy在把一个原本面向个人的 Agent 工作台，逐渐改造成能够承载组织级 AI 协作的基础设施。

这也让“任务入口”的概念有了新的含义。

对个人来说，任务入口意味着“我把事情交给 AI”；对企业而言，任务入口意味着“企业把一整套业务流程交给 AI”。

前者解决的是怎么让 AI 帮人完成工作，后者解决的是怎么让一群 AI 在企业里被管理、被调用、被约束，并持续产出结果。

从模型到 Agent，再到企业 AI 基础设施，不同厂商的路径虽然不同，但争夺的焦点一致：谁能把模型嵌进企业的真实业务流程。

当底层模型能力趋于稳定，围绕“执行与交付”的工程化建造，才刚刚拉开序幕。

---

本文由奇点研究社发布，引用请注明出处：https://www.qidianyanjiushe.com/article/workbuddy
