你有没有发现,这个夏天的AI新闻,越来越有"中国节奏"了?
就在今天早上,两条消息几乎同时刷屏。一条是具身智能公司智在无界发布了新一代模型Being-H0.8,用50万小时人类第一人称视频数据完成预训练,这个数据量目前是全球第一。另一条是DeepSeek悄悄上线了V4-Flash正式版API,Agent能力直接暴涨6倍,价格却只有Claude的九十分之一。
这两件事放在一起看,你会发现一个很有意思的信号。中国AI公司正在用自己的方式,重新定义这场全球竞赛的规则。
50万小时,这到底意味着什么
先说说这个50万小时。
你可能对这个数字没什么概念。我给你算一笔账。一个人从出生到18岁成年,每天醒着16个小时,全年无休,和物理世界交互的总时长大概是10万小时。也就是说,智在无界这次用来训练模型的数据,相当于5个成年人半辈子的人生经验总和。
这不是仿真数据,不是在虚拟环境里生成的合成数据。是真人、真手、真场景下的第一人称视频。有人拿起杯子喝水,有人翻开书本阅读,有人用笔写字,有人在厨房里切菜。这些最普通、最日常的动作,恰恰是机器人最学不会的东西。
为什么?因为物理世界的复杂性,远超所有人的想象。
你在家里随便拿起一个杯子,你的大脑会在瞬间计算杯子的重量、摩擦力、倾斜角度、水的晃动幅度,然后精准调整手指的力度。这个过程你根本意识不到,但机器人要学会这一套,可能需要几百万次试错。
截至2026年初,全球高质量的真实物理交互数据总量加起来也就50万小时左右。而训练一个真正通用的具身基础模型,业内估算需要100万到1000万小时。也就是说,数据缺口超过95%。
谁先拿到足够多、足够好的数据,谁就能率先撞线。这不是什么秘密,但真正敢all in这条路的人,少之又少。

他们不做机器人,却做出了最值钱的东西
有意思的是,智在无界这家公司,根本不生产机器人。
去年融资的时候,投资人反复问创始人卢宗青两个问题。第一个问题是,你为什么不做硬件?第二个问题是,你为什么要用人类视频训练模型?
这两个问题背后,是过去两年整个具身智能行业的集体迷思。大家都觉得,做机器人就得软硬一体,就得自己造本体,就得有漂亮的机械臂和人形外壳,不然你怎么证明你的技术有用?
但卢宗青的判断很简单。硬件没有收敛,就不该被硬件绑住。
什么意思?今天的人形机器人,三个月一小改,半年一大改。今天你花大力气采集了一万小时真机数据,明天硬件一迭代,关节角度变了,传感器位置换了,之前的数据可能大半就作废了。这不是在做积累,这是在反复做无用功。
不是做硬件不重要,是在这个阶段,纯做模型的价值被严重低估了。
2026年1月,硅谷一家叫Skild AI的公司完成14亿美元C轮融资,估值直接跳到140亿美元。这家公司跟智在无界做的事情几乎一模一样——不生产一台机器人,不卖一个机械臂,只卖模型。当时硅谷媒体给它起了个名字,叫"2026年机器人行业第一个百亿美元独角兽"。
你看,不是中国创业者看不懂这个趋势,是愿意在没人看好的时候坚持这条路的人,太少了。
智在无界的模型迭代速度也很惊人。2025年7月的H0版本,只用了3000小时数据。半年后的H0.5版本,数据量涨到3.5万小时,已经能跨本体控制30多种不同的机器人。今年4月的H0.7版本,数据量跳到20万小时,推理速度做到了30赫兹,这在全球世界模型里已经是最快水平。
而这次的H0.8版本,不只是数据量涨到50万小时,更关键的是加入了触觉理解。不是在后训练阶段接个触觉传感器那么简单,是在预训练的时候就让模型理解接触点、力度、材质反馈这些最细微的物理交互信息。
这才是真正的壁垒。不是某一个算法点的突破,是从数据采集、标注、训练到端侧部署的整条管线。这套东西你看不见、摸不着,却决定了模型能力的上限。

DeepSeek又一次把价格打下来了
就在具身智能传来好消息的同一天,大模型赛道也扔出了一颗重磅炸弹。
7月31日晚上,DeepSeek低调上线了V4-Flash正式版API。没有发布会,没有媒体通稿,就悄悄更新了一下API文档。但开发者社区一测完,直接炸了。
这次升级,模型骨架一点没动,只重新做了后训练。结果Agent能力直接暴涨6倍,编程任务能力大幅提升,还原生支持了Responses API格式,可以直接适配Codex。根据Artificial Analysis Intelligence Index的评测,这个模型在开放权重模型里排进了前三。
最狠的是什么?价格。
具体多少钱我就不在这里念数字了,但你只要知道,它的调用成本大概只有Claude的九十分之一。九十分之一是什么概念?你用Claude处理1000个请求花的钱,用DeepSeek可以处理9万个。
这已经不是性价比高了,这是在重新定义这个行业的定价体系。
你有没有想过一个问题?为什么每次都是DeepSeek先把价格打下来?不是因为他们做慈善,是因为他们真的把成本做下来了。从最早的V2到V3,再到现在的V4-Flash,DeepSeek每次发新模型,都会把整个行业的价格基准线往下拉一大截。
这对开发者意味着什么?意味着以前你不敢想的事情,现在可以想了。以前你算ROI算不过来的应用场景,现在可以做了。一个初创团队,不用再担心API账单把公司烧垮,可以放开手脚去试错、去创新。
不是大模型不重要,是大模型正在像水电一样变成基础设施。
当调用成本足够低的时候,真正比拼的就不再是谁的模型参数更大、谁的榜单分数更高,而是谁能把模型用好、谁能在场景里挖出真正的价值。这个转变,其实比模型本身的进步更重要。

中国AI正在走一条没人走过的路
把这两条新闻放在一起看,你会发现一个很清晰的脉络。
不管是智在无界押注人类第一人称视频数据,还是DeepSeek死磕成本效率,中国AI公司走的都不是硅谷那条路。
硅谷的玩法是什么?堆算力、堆参数、烧钱、讲故事、拉高估值。一家公司融个几十亿美元,租几万张GPU,训一个超大模型,然后等着被收购或者上市。这套玩法过去几年确实出了不少成果,但也越来越像一个资本游戏。
中国公司的思路完全不一样。我们不跟你比谁烧的钱更多,我们跟你比谁用更少的资源做出更好的效果。我们不跟你比谁的故事讲得更宏大,我们跟你比谁的东西真正能用、真正便宜、真正能落地。
这不是退而求其次,这是另一种生存智慧。
你想想看,为什么是中国公司最先把大模型价格打到地板价?为什么是中国公司在具身智能数据这件事上最先跑到50万小时?不是我们比别人聪明多少,是我们从一开始就知道,光靠烧钱是烧不出未来的。
卢宗青在接受虎嗅采访时说了一句话,我印象特别深。他说中国和美国在具身智能上本质没有差距,因为双方都还没有找到一条能快速训出通用基础模型的路线。但路线基本定了,就是人类视频。剩下的事情,就是谁能把这条路走得更快、更扎实。
这句话放在整个中国AI产业上,其实也成立。
很多人总说中国AI跟美国还有多大差距,总觉得我们在跟跑。但你仔细看看今天这两条新闻就会发现,在很多方向上,我们已经不是在跟跑了。我们在选自己的路,在定自己的节奏。

写在最后
今天是8月1日,2026年刚好走完了一半多一点。
年初的时候,很多人说今年是AI的"落地元年"。当时我还有点将信将疑,但现在看来,这个判断正在一点点变成现实。大模型越来越便宜,具身智能的数据积累越来越快,应用场景越来越清晰。
你有没有想过,五年后回头看2026年这个夏天,会是什么感觉?
你可能会发现,很多今天看起来还很遥远的事情——机器人走进工厂干活、AI助手真正帮你处理复杂工作、智能设备无处不在——其实就是从这一个个看似不起眼的技术突破开始的。
50万小时只是一个起点,不是终点。九十分之一的价格也只是一个开始,不是结局。
真正的好戏,还在后头。