别再只盯着GPU了:字节新成立AI数据一级部门,大模型竞赛下半场抢的是教材

别再只盯着GPU了:字节新成立AI数据一级部门,大模型竞赛下半场抢的是教材

你有没有发现一个奇怪的现象。

所有科技公司都在说自己要做更大的模型。

1万亿参数不够,5万亿起步,10万亿才敢打招呼。

GPU买了一批又一批,机房建了一个又一个。

可很少有人问一个最朴素的问题:拿什么东西去喂这些模型?

8月12日早上,36氪独家曝出消息:字节跳动近期成立了一个新的一级部门"AI数据与安全",直接跟Seed、Flow、抖音这些核心业务部门平起平坐。

这不是一次普通的组织架构调整。

这是一个信号。

大模型竞赛打到第三年,拼参数拼算力的时代正在收尾。真正卡住所有人脖子的,不是显卡,是数据。

字节AI数据部门成立

模型还没影,数据先升官了

咱们先把这件事拆开看。

新部门负责人叫王赢磊,原来在TikTok负责平台责任团队。

原负责人傅越近期离职。

但人事变动从来都只是表面。

真正值得琢磨的是这个部门的级别——一级部门。

什么概念?Seed是做大模型底座的,Flow是做AI应用的,抖音是字节现金牛。能跟这三个平级,说明数据这件事在张一鸣心里的分量,已经跟模型、应用、核心业务一个等级了。

你可能会说,大公司调整组织架构不是很正常吗?

不正常。

因为时间点太巧了。

就在这条消息出来之前几天,英国金融时报刚刚爆料:字节正在预训练一个参数规模最高可能达到10万亿的超级AI模型。

10万亿参数是什么概念?

现在市面上主流的开源模型大多在7B到70B之间,也就是70亿到700亿参数。GPT-4级别模型外界估算大概在1.8万亿左右。10万亿,是GPT-4的5倍多。

不是简单地把模型做大一圈。

是往Scaling定律的极限上硬怼。

模型要做这么大,光堆GPU肯定不够。按照DeepMind在Chinchilla论文里算过的账,参数翻一倍,训练数据量也得同步翻一倍,模型才能训得充分。

3年前大家还在说"数据是燃料"。

现在燃料不够烧了。

更有意思的是另一个细节。8月5日,The Information报道,张一鸣在大约一个月前的Seed全员会上,明确说了一件事:不准靠蒸馏外部模型来追赶差距。

什么是蒸馏?

说白了就是抄作业。拿别人训好的模型输出结果当训练数据,反过来喂自己的模型。这是一条捷径,能省不少事。

张一鸣把这条路堵死了。

他说,字节应该愿意"为长期目标牺牲一些短期利益",即使Seed阶段性落后,也不应该靠蒸馏竞争对手来补差距。

这就有意思了。

一边奔着10万亿参数去,一边又不准抄近路,那剩下的路只有一条:自己准备足够多、足够好的"教材"。

AI数据稀缺概念

好数据,快被吃干净了

你有没有想过一个问题:互联网上到底有多少字可以拿来训模型?

研究机构Epoch AI算过一笔账。

全球公开的人类文本,扣除掉低质量内容、重复内容之后,满打满算大概300万亿Token。

听着挺多是不是?

但按照过去几年大模型训练数据的增长速度,这批存量数据可能在2026年到2032年之间就要被吃完。如果模型为了降低推理成本搞"过度训练",这个时间点还会提前。

不是危言耸听。

是真的快不够吃了。

最先被盯上的,是那些过去藏在围墙后面的内容。

2024年,Google跟Reddit签了个每年6000万美元的合同,买Reddit论坛上的帖子内容训模型。同一年,OpenAI又跟新闻集团Murdoch达成多年合作,把华尔街日报、泰晤士报这些报纸的历史和实时内容全都包圆了。

论坛买完了,买报纸。

报纸买完了,买专业数据库。

专业数据库买完了呢?

雇人生产。

代码、数学、科学这些高价值领域,大模型公司开始直接花钱雇工程师、博士、行业专家,专门生产训练数据,专门做模型评测。一名算法工程师背后,往往对应着十几名数据人员。

你以为这就到头了?

没有。

今年1月,华盛顿邮报根据法院解封的文件,曝出了Anthropic一个内部代号叫"Project Panama"的项目。

这个项目干什么呢?

买书。切书。扫描书。

Anthropic批量采购了几百万册实体书,用液压切割设备直接切掉书脊,把散页送进高速扫描仪,数字化之后再把原书回收处理。项目启动大约一年时间,花掉了数千万美元。内部文件甚至把目标写成了,要"破坏性扫描全世界所有的书"。

好家伙,直接上物理手段了。

在这之前更绝。Anthropic还从LibGen这类影子图书馆下载过数百万册盗版书籍。这也是后来他们被作家集体告上法庭的直接原因。

2025年法院判了,用书籍训练AI本身可以算合理使用,但Anthropic保存超过700万册盗版书搞"中央图书馆"这事有侵权风险。为了了结官司,Anthropic最后赔了15亿美元和解金。今年7月美国联邦法院正式批准了这笔协议,成为美国历史上规模最大的版权诉讼和解之一。

15亿美元。

这不是罚款。

这是给高质量数据标了一个价码。

数据工程体系

数据不是标注活,是工程体系

你可能会说,不就是找数据吗?有钱还怕买不到?

真没那么简单。

字节这次成立一级部门,还有一个背景:过去字节内部光管数据的团队就有四五套班子。

Global Data最早是傅越2023年成立的,百人左右,一开始服务Dola、TikTok这些国际业务,后来慢慢开始给Seed模型做数据采购和质量管控。

然后集团数据中台DMC有自己的数据团队。

Flow旗下有个AI数据平台叫AIDP,也有一班人。

Seed内部不同的模型方向,也都各自建了自己的数据团队。

这些团队服务的对象不一样,但干的活越来越像:采购数据、组织标注、搭数据集、负责模型评测和质量控制。结果就是,同样是给大模型准备数据,字节内部长出了好几套重复的班子。

这不是字节一家的问题。

几乎所有大模型公司都在经历这个阶段。

一开始大家觉得数据就是找外包公司做标注,几百块钱一条,便宜得很。

等模型做到一定规模才发现根本不是那么回事。

从数据采购、清洗、合成,到模型评测、质量控制,这根本不是劳动密集型的标注生意,是一整套需要单独组织、持续投入的系统工程。

光有钱买数据还不够。你得有人判断什么数据是好的,什么数据是有毒的,什么数据会让模型"学坏"。你得有体系保证喂进去的数据质量是稳定的,不能今天好明天差。你还得有能力自己合成数据,因为人类写出来的东西总有吃完的一天。

这也是为什么字节把这个部门直接升到一级。

这不是成本中心。

这是未来3年大模型竞赛的主战场。

据智能涌现此前披露,字节仅Seedance一个方向的数据评测团队就有上千人。今年字节在世界模型和Coding等方向的数据预算已经达到千万美元级别,而且还可以继续追加。

千万美元级只是开始。

等10万亿参数模型真的启动训练,这个数字后面再加个零都不奇怪。

全球AI竞争格局

中国公司的特殊困境

你可能会问,国外公司也缺数据,字节面临的问题有什么不一样?

太不一样了。

OpenAI有英语世界几乎整个互联网的存量内容可以用。Anthropic敢花几千万美元扫实体书,敢赔15亿美元跟作家和解。Google手握搜索、YouTube、Gmail,全世界最大的几座数据矿山就在自己家里。

中国公司呢?

中文互联网的高质量存量内容本来就比英文少。

优质的论坛、博客、专业内容,这几年要么关闭了,要么变成了信息流里的标题党和软文。知乎质量下滑不是新闻了,小红书是生活方式内容多但专业深度内容少,微信公众号的内容封闭在微信生态里想爬也爬不到。

买内容这条路也没那么顺畅。

国内出版社、媒体、作家对AI训练数据的授权还处在非常早期的阶段,没有成熟的商业模式,也没有清晰的定价体系。你想花钱买,都不一定找得到对接的人。

那怎么办?

自己造。

这也是为什么张一鸣敢拍板说不蒸馏。蒸馏别人的模型,短期能追上进度,但长期看你永远在别人后面吃灰,永远不知道数据源头是怎么回事。只有自己从最底层的数据生产、清洗、标注、评测体系开始搭,才有可能真正做出别人没有的东西。

这条路更难,更慢,更烧钱。

但走通了,就是真正的壁垒。

你看今年大模型行业的几个变化就懂了。

年初大家还在比谁的模型榜单分数高,年中开始比谁的Coding能力强、谁的Agent好用。到了下半年,明眼人都看出来了:头部那几家的基础模型能力差不了太多,真正拉开差距的是应用场景,是工程化能力,是你有没有独家的数据飞轮。

不是模型不重要了。

是模型本身已经很难成为绝对壁垒了。

结尾

大模型竞赛打了快4年。

第一阶段拼的是谁敢烧钱买GPU,谁能先把模型跑出来。

第二阶段拼的是谁的应用做得好,谁能找到PMF,谁能把Token变成真金白银的收入。

现在第三阶段开始了。

这个阶段拼的是谁能建立自己的数据供应链。谁能持续生产出别人没有的高质量数据,谁能把数据从"标注外包"变成一套精密运转的工程体系,谁就能在下一轮模型迭代里占得先机。

字节这次把数据部门升到一级,只是掀开了这幕大戏的一角。

接下来你会看到越来越多的公司把数据提升到战略高度。

不是因为他们突然重视数据了。

是因为他们终于发现,GPU有钱就能买,模型有人才就能训,但好数据,是真的要一寸一寸去啃的硬骨头。

咱们等着看。