AI 产品的差距,早就不在模型上了
你打开常用的 AI 助手,打下一行字,按回车,两秒,答案回来了。
你有没有想过,中间发生了什么?
大多数人的想象是:我在跟一个 AI 说话,一个足够聪明的模型。发布会也一直这么暗示——我们升级了模型,所以产品更强了。
这个理解,现在错得离谱。
这篇不是技术考古,是我站在产品这侧,把大家天天在用的 AI 拆成四层——数据、模型、工程层、智能体——看看你感受到的聪明和笨,到底各是哪一层决定的。我不搞算法,说人话。拆到最后你会发现,Muse、Today、还有 D 厂这波 personal agent 大战,抢的东西跟新闻里说的不是一回事。
一、你对话的,从来不是「一个 AI」
先劈一个共识:AI 产品的差距,就是模型的差距。
这个共识最坑的地方在于,一年前它还是对的。2025 年那会儿,谁家模型跑分高,谁家产品就真的更好用。但到 2026 年,行业分析里出现了一组反直觉的数字:前沿模型之间的基准差距,收敛到了 5% 以内;同期 token 价格从 2023 年算起跌了九成,8 月底硅谷数据机构的 token 物价指数只剩 97 美分,不到夏季高点的一半。
翻成人话:脑子跟脑子之间,已经大差不差,而且越来越便宜。
可你明明能感觉到,不同 AI 产品的体验差得很远。同一个「脑子」,装进不同的产品,怎么就成了两个东西?
因为模型本体只会一件事:接话茬。它不能上网,不能读你的文件,不能记住你三句话之前说过什么,它甚至不知道今天几号——每次对话,对它来说都是第一次见你。
那你为什么觉得它记得你?
因为外面有人给它配了一整套装备。这就到了 2026 年真正拉开差距的那一层。
二、真正拉开差距的,是那层看不见的工程
四层里最陌生的就是这层,先讲它,因为今年的故事全发生在它身上。
这层东西,英文圈叫 harness。这词的本义是马具——套在马身上的挽具,让马力变成能拉车的功,「驾驭」的驭,说的就是它。中文一般翻成「脚手架」或「模型套件」,都差点意思,下文直接用英文。
Anthropic 给过官方定义:harness 是模型外围的软件脚手架——工具调用、循环、上下文管理、护栏——把原始智能变成能干活的 agent。行业公式就一条:agent = model + harness。
拿大家熟悉的东西举例:Claude Code 就是一个 harness。同一个 Claude 模型,你裸调 API,它只会聊天;套上 Claude Code,它能读代码库、跑测试、改文件。业内的说法是,两支团队用同一个模型做出来的 agent,像两个世界。
这件事出圈的速度比我预想的快。9 月,头部券商的研报里已经写着:AI Agent = 模型 + Harness 共识增强,产业竞争从模型层转向应用层 Harness。工程师的黑话半年就进了券商研报——对做产品的人来说,这个信号比任何发布会都真实:模型的军备竞赛快收尾了,装备的军备竞赛刚开始。
拿招聘打比方。模型是候选人的脑子,2026 年市面上脑子的差距已经小到可以忽略。可同一个聪明的脑子,配上工位、权限、SOP、工具箱,是一种产出;什么都不配,是另一种产出。
你平时吐槽「这 AI 好笨」,很多时候笨的不是脑子,是它工位上的东西没配齐。
(比如记忆,harness 里的核心件之一。你有没有过这种体验:昨天跟 AI 交代过的事,今天它全忘了,你得从头再说一遍。这不是错觉——海外一份 9 月的亚太用户调研:70% 的消费者因为 AI「不记得我」中途放弃对话,而 84% 的厂商以为自己的 AI 认得回头客。中间 14 个点的认知错位,全卡在记忆这个件上。)
三、脑子为什么白菜了:往下一层是数据
那模型层为什么不卷了?不是不想卷,是口粮先出了问题。
模型的本事是从数据里「吃」出来的。DeepSeek-V3 的技术口径,预训练吃了 14.8 万亿个 token 的文本。可互联网上能爬的高质量文本是有限的,研究机构 EPOCH AI 的预测是 2026 到 2032 年之间见底。中文还有个额外麻烦:业内估算,英文语料的规模约是中文的八倍,中文模型这几年是真在贫矿里炼钢。
公共数据见顶,各家模型你喂我我喂你,差距就收敛了;再加上推理工程一路优化,token 价格砸穿地板。这两件事其实是同一件事:模型层从技术壁垒变成了通用件——行业里管这叫「可插拔的层」,跟攒电脑挑 CPU 一样,谁都能买到。
脑子白菜价了,挽具成了壁垒。
四、Muse、Today、还有 D 厂,抢的是同一个位置
现在回头看 9 月这三场发布,就看懂了。
海外社交巨头 Meta 的 Muse,9 月 8 日:每个用户一个独立的云端虚拟机,里面住着主 agent 外加一个专门审查它的 Sentinel——要花钱、发邮件这类敏感操作,先过审。你关掉 App,它在后台接着干活。订阅分档收费,每月几十到上百美元。
Today,9 月 24 日中国版上线:齐俊元做的,这人 19 岁创办的协作工具公司卖给了大厂,后来在 D 厂管过那个国民级 AI 助手的 PC 端。产品五个入口——Chat、Today、Tasks、Memories、主页,能接 32 个外部服务。核心叙事就一句话:你不找它的时候,它还在替你干活。
D 厂——就做短视频起家那家,它家那个 3.82 亿月活的 AI 助手你大概率用过——9 月 14 日发了手机助手消费者版,两天后有量产机开售,全球第一款打「AI 智能体手机」标签的手机。识屏办事、AI 键加指纹、读你的相册短信建本地记忆。再往前一个月,8 月 25 日发了企业级的工作版 agent,9 月中又在自家办公套件的大会上发团队智能体,一号位亲自到场,只讲了一句要紧的:Agent 进入可用阶段后,Agent、模型、协作环境必须紧密融合。组织上也是这么动的——7 月底以来,办公套件团队、智能体开发平台、AI 编程工具,全并进了 D 厂的 AI 体系。
(一个细节:据 9 月的媒体报道,有 D 厂员工感慨自家的对话产品是「日活超 2 亿的边缘产品」。边缘吗?从四层看一点也不边缘——它是将来给 agent 喂个人数据的那个入口。)
三家抢的,表面是入口。法学教授杨东提过一个概念,更准:意图分发权。你说「帮我订周五去北京的机票」,这个意图分发给谁去执行,谁就是下一代流量入口。QuestMobile 在 7 月的半年报里也写了类似判断:APP 的功能会被封装成 Skill,「人找服务」会变成「被 AI 引用」。
但往深一层看,抢的是数据——第三层数据里的个人数据。模型厂商缺的从来不是脑子,是你:你的日历、聊天、消费、健康。吕本富教授 2024 年底就有个判断,现在看特别准:公共数据快用完了,但每个人一生的记忆数据,还锁在个人生活里,没人挖到。
拿招聘再打一次比方。同样一个新脑子,跟了你三年,记得你所有客户、口味、踩过的坑——这叫老助理。第一天入职,什么都得从头教——这叫 chatbot。模型可以是同一个,差的是跟你共事的时间,也就是数据。
personal agent 之争,本质是谁先当上你的老助理。而你跟一个助理共事越久,换人成本越高——这是比当年 App 抢入口狠得多的锁定。想明白这个,你就明白为什么 Meta 亏着本也要留免费档,为什么 Today 上来就送 1 亿 token:抢的不是你这个月的订阅费,是未来三年你的全部数字生活。
五、浑水也真的多
写到这,得先把最不体面的质疑说完。
质疑一:概念本身就是混的。Gartner 造了个词,agent washing,洗智能体——把聊天机器人、自动化脚本换个智能体的皮重新卖。他们的判断是,市面上数千家智能体厂商,有完整核心能力的只有约 130 家(这组数字 Gartner 去年年中发布,今年国内媒体报道还在引用,因为没人能推翻)。国内央媒今年的口径更直白:七成所谓智能体,是大模型的简易封装。
质疑二:产品是真的糙。D 厂自己发布当天就把短板摆上了桌:GUI Agent 还在早期,复杂界面容易看走眼,长任务稳定性是硬伤。行业里「三周做出惊艳 demo,灰度两周被迫叫停」是常态。用户留存也是滑雪道:AI 应用 30 天留存平均 18.7%,传统软件是 35.2%;粘性比 21%,微信是 70% 以上。
质疑三:这剧本 15 年前演过。2011 年,Siri 挂着「和蔼的个人助手」的招牌随 iPhone 4S 发布,苹果高管在台上讲它能理解你的意图。结果没记忆、没第三方集成、规则式应答,十五年没兑现。
那这次凭什么信?我的判断是:Siri 那次缺的恰好是四层里的三层——没有大模型这个脑子,没有 harness 这套装备,没有个人数据这份记忆。方向对了,年代错了。现在四层是第一次凑齐。
但凑齐不等于稳赢。Gartner 预测四成的 agent 项目会在 2027 年底前被砍;MIT 今年一项覆盖 300 个企业 AI 部署的研究说,95% 的试点没有可衡量的财务回报,根因朴素得离谱:你自己的业务流程从来没被写下来过。agent 不是替你补这个洞的,它是第一次把这个洞摊开给你看。
对做产品的人来说,这一条值得抄下来。
六、看懂任何一场 AI 发布会,问三个问题
拆完了。四层:数据是口粮,模型是脑子,harness 是装备,agent 是真在干活的那套组合。以后刷到任何 AI 产品的新闻,不用管话术多花,问三个问题就够:
-
发的是哪一层? 看它在比参数跑分,还是在演示「我替你办完了一件事」。前者是脑子,后者是组合。
-
记忆从哪来? 本地攒的、外部接的、还是没有。没有记忆的 agent,再炫也是高级 chatbot。
-
权限给到哪层? 只读、可写、还是可花(花钱、下单、发邮件)。给得越多越能干,也越需要你掂量。
顺手能做的一件事:回去翻一下你常用那个 AI 的权限页,看它到底申请了什么。今年 5 月,智能体治理的国家级文件落地了,权限管理和用户知情权都写在里面——你至少得知道自己交出去的是什么。
回到开头那个问题。你按回车,谁在回你?一个脑子,一整套装备,一堆你的数据,再加一家抢着当你助理的公司。
上个月,国内某电商巨头的一号位在自家开发者大会上说了两句话:机器思考的总量会是人类的一千倍;真正定义时代的 AI 产品,到今天还没出现。
你天天在用的这些 AI,热闹成这样,最大那家的一号位说戏才刚开场。这话你可以当营销听,也可以想想另一面——
现在排队等你授权的那些 App,每一个都在面试「你的老助理」这个岗位。
常见问题
什么是 AI 的 harness?
harness 指模型外围的工程脚手架——工具调用、任务循环、上下文管理、记忆与护栏。行业公式是 agent = model + harness。同一个模型,裸调 API 只会聊天,套上 harness 才能读文件、执行任务、记住你。
为什么说 AI 产品的差距不在模型?
前沿模型的基准差距已收敛到 5% 以内,token 价格从 2023 年起跌了九成,模型成了可插拔的通用件。体验差异主要来自数据与 harness 两层——尤其是记忆、工具与权限的配置。
personal agent 大战抢的是什么?
表面是入口,实质是个人数据与「意图分发权」。谁先成为你授权的「老助理」,谁就锁定你未来三年的数字生活——换掉一个记得你所有偏好的助理,成本远高于换一个 App。