AI 助手换工具实录:用了大半年 Codex,我为什么换成 Kimi Work

2026-08-25

海星体育平台

摘要:本文以第一人称叙述,详细记录了从 Codex 全面迁移至 Kimi Work 的真实体验。文章首先阐述了国内使用 Codex 时面临的四大痛点(网络连接、账号管理、支付流程、合规要求),随后逐项剖析了 Kimi Work 的核心功能:Goal 模式实现了从“指挥它做”到“告知它要什么”的交互方式转变,Agent Swarm 支持超过 300 个智能体并行处理批量任务,WebBridge 作为浏览器自动化智能体(而非搜索摘要),定时任务可按时自动执行,专业数据库原生集成,多格式文档生成,以及插件与本地文件整合。文章也坦诚指出了 Kimi Work 的不足之处,并给出了适合与不适合使用的用户群体判断。桌面智能体的真正价值并非 AI 变得更聪明,而是 AI 终于能跨越聊天窗口,直接协助用户完成工作。

这是 AIHOT 大模型排行榜的最新总榜,于 8 月 25 日更新,综合了七家公开榜单的共识评分。前五名中,Claude Fable 5、Claude Opus 5、GPT-5.6 Sol 占据前三,第四名为 Kimi K3——AIHOT 共识分 79.8,评测完整度 84.5%。但价格栏更值得关注:Kimi K3 输入成本为每百万 Token ¥20,输出为每百万 Token ¥100,而 Claude Opus 5 分别为 ¥33.61 和 ¥168.07,GPT-5.6 Sol 分别为 ¥33.61 和 ¥201.68。Kimi K3 在能力排名第四的同时,价格仅为头部模型的一半到三分之一。然而,仅看榜单和价格不够,决定是否更换的关键在于每天使用时的实际工作体验。

使用 Codex 大半年后,我在 2026 年夏天彻底切换至 Kimi Work。并非 Codex 不好,而是在国内使用它的综合成本过高——代理断连、账号过期、支付繁琐、数据出境缺乏保障。切换前我也犹豫,担心能力下降影响工作。使用一个月后,本文讲述真实体验。

一、Codex 的四大痛点,每个都亲身经历首先说明我更换的原因。

第一个痛点是网络。Codex 的 OAuth 登录页面在国内常打不开,代理节点时好时坏。有时急需使用时,登录环节就卡住十分钟。CLI 稍好一些,但 Responses API 在国内中转站兼容性差,经常出现配置好后 Agent 功能无法运行的情况。

第二个痛点是账号。ChatGPT 账号注册需海外手机号,2026 年风控收紧后共享账号成片被封。我买过一个共享号,使用两周后便无法登录,之前的会话记录全部丢失。

第三个痛点是支付。ChatGPT Plus 每月 20 美元,虚拟信用卡要手续费,汇率转换有损耗,实际成本远不止 20 美元。而且虚拟卡随时可能被拒付,续费中断后便无法使用。

第四个痛点是合规。我从事内容运营,会接触未公开的业务数据和合作方文件。将这些内容发送至境外服务器,公司后来明确要求不得使用未经安全评估的海外 AI 工具处理工作文件。这是让我下决心更换的关键原因。

这四个痛点叠加,让我觉得继续使用 Codex 的性价比越来越低。并非它能力不足,而是使用成本和风险已超过其带来的效率提升。

二、Goal 模式:从“指挥它做”到“告知它要什么”Kimi Work 给我的第一个不同感受是 Goal 模式。

以前使用 Codex,我的角色是指挥官。做一份竞品调研,我得说“先搜这五家公司的官网”“把定价信息复制出来”“整理成表格”“写成文档”,一步一步盯着。每一步都需我发出指令,AI 执行后等待下一步。

Goal 模式改变了我的角色。我只说明需要什么、什么算合格、有什么限制,它自行想办法完成。

第一次尝试,我给了个真实任务:“分析国内五款桌面 Agent 产品的定价和核心功能,输出 Markdown 格式报告,每个产品覆盖定价、核心功能、目标用户三个维度,信息来源限官网,无法访问的标注出来。”然后我去开会。

一小时后回来,报告已生成。它通过 WebBridge 逐个打开官网,提取定价和功能信息,有一家官网改版导致页面结构变化,它标注了“部分信息可能不完整”。我核对了一遍,信息基本准确,只有一处定价是旧的,手动修改了。

这种体验的差别并非 AI 变聪明了多少——模型能力大家都在同一梯队——而是交互范式变了。你从“一步步指挥”变为“定义目标验收结果”。节省的不是打字时间,而是认知负荷:你无需将任务拆解成 AI 能执行的步骤,只需想清楚自己要什么。

Goal 模式也非万能。我后来发现,Goal 写得越模糊结果越差。“帮我做个调研”这类指令生成的内容无法使用。将目标、验收标准、约束条件写清楚后,效果明显提升。一个可靠的 Goal 通常包含五个要素:结果是什么、验收证据是什么、范围约束是什么、预算限制是什么、失败后如何处理。

Goal 执行过程中可能调用多个 Agent 协作,具体任务分配由系统自动调度,我无需关心内部如何分工。整个过程可观察、可介入,我可随时查看中间结果、调整方向或停止。它不会盲目地朝一个未定义的目标一直运行。

三、Agent Swarm:300 个 Agent 协同工作另一个让我印象深刻的是 Agent Swarm。

有一次需从 150 多份 PDF 合作协议中提取甲方、乙方、金额、签约日期、到期日期,汇总成 Excel。使用 Codex 处理,我得写 Python 脚本、调试 PDF 解析库、处理各种格式异常,本质上是指挥它编写一个数据处理程序。

在 Kimi Work 中,我写了一个 Goal:“读取合同文件夹中所有 PDF,提取甲方乙方金额签约日期到期日期,汇总成 Excel,按到期月份分 sheet。”它启动多个 Agent 并行读取,二十多分钟后 Excel 已存至桌面。有十几份扫描件识别不准,它标记出来让我核对,没有胡乱填写。

Agent Swarm 最多支持调用超过 300 个 Agent 协同工作。面对大批量任务,系统自动唤醒多智能体网络,将大任务拆成子任务并行处理,最后汇总结果。这里没有所谓主 Agent 在指挥,Agent 之间根据任务需要动态协作,分工由系统决定,用户无需关心内部调度。

这种能力在批量场景下价值明显。一次性分析几十家竞品的官网信息、处理上百份文档提取关键数据、扫描大量论文做文献综述,串行处理可能需几小时,多 Agent 并行可大幅缩短时间。

当然,信息提取难免有误差,尤其是扫描件和格式不规范的文件。Kimi Work 会将不确定的地方标记出来,而非胡乱填写。这一点比给出一个看似完整但有错误的结果要好得多。

四、WebBridge:操作浏览器,而非搜索摘要还要说的是 WebBridge。

许多人将 WebBridge 理解为“联网搜索”,这是误解。WebBridge 本身就是一种 Agent,它实际操作浏览器——打开网页、点击链接、填写表单、等待加载、抓取动态内容、下载文件。它沿用你浏览器已有的登录会话,能访问需要登录才能看到的内容。

这与模型联网搜索是两回事。联网搜索是调用搜索引擎 API 获取文本摘要,你拿到的是二手信息,可能过时、不完整、无法搜索到动态渲染的内容。WebBridge 是实际打开浏览器,看到完整渲染后的页面,执行真实操作。

我用 WebBridge 做过一件事:在一个后台系统中批量导出 30 份数据报表。该系统没有 API,只能手动点击——登录、选日期、点导出、等下载、重复 30 次。WebBridge 像真人一样操作,点击、等待、下载,中间有两次页面加载超时,它自动重试。四十多分钟完成,我去做别的事了。

在 BrowseComp 浏览器操作基准测试中,Kimi K3 得分 91.2。这个基准衡量的就是真实浏览器操作能力,而非搜索能力。

WebBridge 也有局限。有些网站使用了复杂的反爬机制或非常规前端组件,WebBridge 可能找不到元素或点击位置不对。它会重试和报错,但并非每次都能成功。这是所有浏览器自动化工具的共同局限,并非 Kimi Work 独有。

五、定时任务:到点自动工作还有一个能力是定时任务,这是 Codex 不具备的。

Codex 是交互式工具,你叫它它才动,没有定时执行功能。你想让它每天早上自动生成一份行业早报?得自己搭建 cron job 或 GitHub Actions,配置成本不低。

Kimi Work 内置定时任务引擎,就一种模式,设定时间和频率后到点自动执行 Goal。免费版可设置 2 个定时任务,随套餐升级可设置更多。可手动创建,也可直接用自然语言说“每天早上 7 点半生成 AI 行业早报”,系统自动转换为定时任务。

我设置了一个每天早上 7 点半的早报任务,自动抓取几个 AI 行业信息源,按类别整理成早报存至桌面。到公司打开电脑就能看到。偶尔有信息源网站改版导致抓取失败,它会在报告中标注哪条没抓到,不会静默失败。

这个能力看似简单,但它让 AI 从“你叫它才动”变为“它主动工作”。每天重复的信息收集、每周固定的文件整理、每月例行的数据汇总,设定一次就持续运行,无需人介入。

六、专业数据库和文档生成除了上述四个核心能力,Kimi Work 还有两个对知识工作者特别有用的功能。

专业数据库原生接入。金融方向接入同花顺,企业信息接入天眼查,法律方向接入华宇元典。这些是直连数据库,而非网页搜索,数据结构化且准确。做金融分析的,无需自己找数据源、手动导出再导入,一个请求就能从原始数据推进到分析报告。在 Finance-Bench 金融分析基准测试中,Kimi K3 得分 62.6。

文档生成支持 PPT、Excel、PDF、Word 等多种格式。做方案、做汇报、整理会议纪要,直接输出可用格式。在 DECK-Bench 演示文稿测试中,Kimi K3 得分 73.5,Online Exp Bench 在线任务测试中得分 75.5。生成的 PPT 不算惊艳但结构完整、排版可用,省掉大量调格式的时间。

插件生态支持飞书、钉钉、WPS、Notion、百度网盘、Canva、Cloudflare 等主流服务。需说明的是,插件和技能是不同概念:技能是封装好的可复用工作流,Hooks 是关键节点自动执行的脚本,MCP 是连接外部工具的协议,插件是把 Skills、Hooks 和 MCP 配置打包在一起的完整能力包。即使不安装任何插件和技能,Kimi Work 的核心能力也是完整可用的,不存在能力固定不变的情况。

本地文件深度集成也是一个实用功能。可关联本地文件夹,直接读写处理文档、表格、PDF;支持自定义看板组件,将信息固定在桌面随时查看。

七、Kimi Code 和 API:编程和定制的补充 Kimi Work 并非为重度编码设计。偶尔写个脚本、改个配置没问题,但若你每天 8 小时写代码,应使用 Kimi Code。

Kimi Code 是独立的 AI 编程工具,有 CLI、VS Code 插件和 web 端三种形态,默认 K2.7 Code 模型可切换 K3,支持 Plan 模式、goal 模式、Sub-agents、Agent Swarm、HighSpeed 高速模式。它与 Codex CLI 的使用方式一致,是编程场景的直接替代。

一个会员,Kimi Work 和 Kimi Code 都能使用,具体权益和配额以各产品页面为准。在 Kimi Work 中遇到重度编码任务,可切换到 Kimi Code 处理。

若需将 AI 能力嵌入自己的工作流,Kimi API 提供标准 HTTP 接口,按 token 计费。可在 CI/CD 中加自动代码审查,写脚本批量处理代码或文档,在内部工具中接入 AI 能力,编排自动化工作流。例如,Kimi Code 写完代码后,通过 API 触发 Kimi Work 生成更新日志,再推送到团队协作工具。

八、其他国产方案简评试 Kimi Work 前后我也看了几款其他产品,简单说说。

TRAE 是字节跳动的 AI 原生 IDE,全称 The Real AI Engineer。TRAE IDE 国内个人版免费,适合习惯完整 IDE 环境、希望 AI 深度融入开发流程的开发者。

QoderWork CN 是阿里 Qoder CN(阿里旗下,与通义灵码并行)的办公端,本地优先架构,文件操作在本地完成,支持多模型切换和 MCP 协议扩展,适合对数据本地化有较高要求的用户。

WorkBuddy 是腾讯 2026 年 3 月推出的全场景 AI 办公工作台,与 CodeBuddy 同属一个产品矩阵,深度集成企业微信和腾讯文档,适合已在腾讯生态内的团队。

这几款各有侧重,但 Kimi Work 在 Goal 模式成熟度、多 Agent 协作规模、浏览器自动化能力和专业数据接入的完整性上,是我用过的综合能力较为全面的选择。

九、Kimi Work 做不到的事说了好的,也要说不好用的地方。

复杂网页操作偶尔会失败。反爬机制强或前端组件非常规的网站,WebBridge 可能找不到元素。

Goal 模式对目标描述质量要求高。写不清楚目标,它会在错误方向上运行很久。建议复杂 Goal 先跑一小轮看方向是否正确。

插件生态还在成长。已支持飞书、钉钉、Notion、WPS 等主流服务,但一些小众工具和垂直领域尚未有官方插件。

编程能力不如专门的编程工具。Kimi Work 能写代码、改文件、跑测试,但日常重度编码应使用 Kimi Code。

长任务稳定性有提升空间。连续运行数小时的 Goal 偶尔会在某个环节卡住,需人工介入。这是当前所有桌面 Agent 的共同问题。

十、适合谁,不适合谁适合 Kimi Work 的人:工作以信息处理为主的知识工作者——运营、市场、产品、咨询、金融、研究、法务。需要定时自动化的人。有合规要求、数据不能出境的职场人。编程加办公都有需求的人(Kimi Work 加 Kimi Code 组合)。

不太适合的人:每天 8 小时重度编码的程序员(应使用 Kimi Code 或其他编程工具)。追求对 AI 每一步精细控制的人(Agent Swarm 分工由系统自动调度,黑盒感可能让控制欲强的人不舒服)。只需聊天问答的人(任何大模型产品都够用,不需要桌面 Agent)。有稳定海外网络和合规账号、且团队深度绑定 OpenAI 生态的人(Codex 在编程场景依然成熟)。

十一、收尾使用一个月 Kimi Work,我的感受是:桌面 Agent 真正的价值并非 AI 变得更聪明,而是 AI 终于能跨越聊天窗口直接帮你工作了。

Goal 模式让你定义目标而非拆解步骤,WebBridge 让 AI 操作真实浏览器而非搜索摘要,定时任务让 AI 主动工作而非等你指令,300 个 Agent 并行让大批量任务不再是煎熬。这些能力组合在一起,改变的不是某一个功能的体验,而是你跟 AI 协作的方式。在 2026 年的国内环境下,它是我用过的桌面 Agent 中综合能力、可用性和合规性平衡得较好的选择。免费版可设置 2 个定时任务、体验基础功能,建议先拿一个真实工作任务试试。适合自己再付费,不适合删除也没损失。

工具是手段,把事情做完做好才是目的。

查看详情

精彩评论

张伟

海星体育平台,自2012年创立,已成为中国领先的体育赛事综合服务提供商。我们聚焦足球、篮球、电竞等多元化热门赛事,为全球用户提供实时动态、深度解析及权威资讯。

李娜

作为海星体育(中国)官方网站,HXSPORTS平台汇聚全球体育精彩,提供足球、篮球、电竞等赛事的即时比分、精准赛程和专业分析,致力于打造一流的体育信息聚合与互动空间。

发表您的观点