你有没有发现一个奇怪的现象。
所有科技公司都在说自己要做更大的模型。
1万亿参数不够,5万亿起步,10万亿才敢打招呼。
GPU买了一批又一批,机房建了一个又一个。
可很少有人问一个最朴素的问题:拿什么东西去喂这些模型?
8月12日早上,36氪独家曝出消息:字节跳动近期成立了一个新的一级部门"AI数据与安全",直接跟Seed、Flow、抖音这些核心业务部门平起平坐。
这不是一次普通的组织架构调整。
这是一个信号。
大模型竞赛打到第三年,拼参数拼算力的时代正在收尾。真正卡住所有人脖子的,不是显卡,是数据。

模型还没影,数据先升官了
咱们先把这件事拆开看。
新部门负责人叫王赢磊,原来在TikTok负责平台责任团队。
原负责人傅越近期离职。
但人事变动从来都只是表面。
真正值得琢磨的是这个部门的级别——一级部门。
什么概念?Seed是做大模型底座的,Flow是做AI应用的,抖音是字节现金牛。能跟这三个平级,说明数据这件事在张一鸣心里的分量,已经跟模型、应用、核心业务一个等级了。
你可能会说,大公司调整组织架构不是很正常吗?
不正常。
因为时间点太巧了。
就在这条消息出来之前几天,英国金融时报刚刚爆料:字节正在预训练一个参数规模最高可能达到10万亿的超级AI模型。
10万亿参数是什么概念?
现在市面上主流的开源模型大多在7B到70B之间,也就是70亿到700亿参数。GPT-4级别模型外界估算大概在1.8万亿左右。10万亿,是GPT-4的5倍多。
不是简单地把模型做大一圈。
是往Scaling定律的极限上硬怼。
模型要做这么大,光堆GPU肯定不够。按照DeepMind在Chinchilla论文里算过的账,参数翻一倍,训练数据量也得同步翻一倍,模型才能训得充分。
3年前大家还在说"数据是燃料"。
现在燃料不够烧了。
更有意思的是另一个细节。8月5日,The Information报道,张一鸣在大约一个月前的Seed全员会上,明确说了一件事:不准靠蒸馏外部模型来追赶差距。
什么是蒸馏?
说白了就是抄作业。拿别人训好的模型输出结果当训练数据,反过来喂自己的模型。这是一条捷径,能省不少事。
张一鸣把这条路堵死了。
他说,字节应该愿意"为长期目标牺牲一些短期利益",即使Seed阶段性落后,也不应该靠蒸馏竞争对手来补差距。
这就有意思了。
一边奔着10万亿参数去,一边又不准抄近路,那剩下的路只有一条:自己准备足够多、足够好的"教材"。

好数据,快被吃干净了
你有没有想过一个问题:互联网上到底有多少字可以拿来训模型?
研究机构Epoch AI算过一笔账。
全球公开的人类文本,扣除掉低质量内容、重复内容之后,满打满算大概300万亿Token。
听着挺多是不是?
但按照过去几年大模型训练数据的增长速度,这批存量数据可能在2026年到2032年之间就要被吃完。如果模型为了降低推理成本搞"过度训练",这个时间点还会提前。
不是危言耸听。
是真的快不够吃了。
最先被盯上的,是那些过去藏在围墙后面的内容。
2024年,Google跟Reddit签了个每年6000万美元的合同,买Reddit论坛上的帖子内容训模型。同一年,OpenAI又跟新闻集团Murdoch达成多年合作,把华尔街日报、泰晤士报这些报纸的历史和实时内容全都包圆了。
论坛买完了,买报纸。
报纸买完了,买专业数据库。
专业数据库买完了呢?
雇人生产。
代码、数学、科学这些高价值领域,大模型公司开始直接花钱雇工程师、博士、行业专家,专门生产训练数据,专门做模型评测。一名算法工程师背后,往往对应着十几名数据人员。
你以为这就到头了?
没有。
今年1月,华盛顿邮报根据法院解封的文件,曝出了Anthropic一个内部代号叫"Project Panama"的项目。
这个项目干什么呢?
买书。切书。扫描书。
Anthropic批量采购了几百万册实体书,用液压切割设备直接切掉书脊,把散页送进高速扫描仪,数字化之后再把原书回收处理。项目启动大约一年时间,花掉了数千万美元。内部文件甚至把目标写成了,要"破坏性扫描全世界所有的书"。
好家伙,直接上物理手段了。
在这之前更绝。Anthropic还从LibGen这类影子图书馆下载过数百万册盗版书籍。这也是后来他们被作家集体告上法庭的直接原因。
2025年法院判了,用书籍训练AI本身可以算合理使用,但Anthropic保存超过700万册盗版书搞"中央图书馆"这事有侵权风险。为了了结官司,Anthropic最后赔了15亿美元和解金。今年7月美国联邦法院正式批准了这笔协议,成为美国历史上规模最大的版权诉讼和解之一。
15亿美元。
这不是罚款。
这是给高质量数据标了一个价码。

数据不是标注活,是工程体系
你可能会说,不就是找数据吗?有钱还怕买不到?
真没那么简单。
字节这次成立一级部门,还有一个背景:过去字节内部光管数据的团队就有四五套班子。
Global Data最早是傅越2023年成立的,百人左右,一开始服务Dola、TikTok这些国际业务,后来慢慢开始给Seed模型做数据采购和质量管控。
然后集团数据中台DMC有自己的数据团队。
Flow旗下有个AI数据平台叫AIDP,也有一班人。
Seed内部不同的模型方向,也都各自建了自己的数据团队。
这些团队服务的对象不一样,但干的活越来越像:采购数据、组织标注、搭数据集、负责模型评测和质量控制。结果就是,同样是给大模型准备数据,字节内部长出了好几套重复的班子。
这不是字节一家的问题。
几乎所有大模型公司都在经历这个阶段。
一开始大家觉得数据就是找外包公司做标注,几百块钱一条,便宜得很。
等模型做到一定规模才发现根本不是那么回事。
从数据采购、清洗、合成,到模型评测、质量控制,这根本不是劳动密集型的标注生意,是一整套需要单独组织、持续投入的系统工程。
光有钱买数据还不够。你得有人判断什么数据是好的,什么数据是有毒的,什么数据会让模型"学坏"。你得有体系保证喂进去的数据质量是稳定的,不能今天好明天差。你还得有能力自己合成数据,因为人类写出来的东西总有吃完的一天。
这也是为什么字节把这个部门直接升到一级。
这不是成本中心。
这是未来3年大模型竞赛的主战场。
据智能涌现此前披露,字节仅Seedance一个方向的数据评测团队就有上千人。今年字节在世界模型和Coding等方向的数据预算已经达到千万美元级别,而且还可以继续追加。
千万美元级只是开始。
等10万亿参数模型真的启动训练,这个数字后面再加个零都不奇怪。

中国公司的特殊困境
你可能会问,国外公司也缺数据,字节面临的问题有什么不一样?
太不一样了。
OpenAI有英语世界几乎整个互联网的存量内容可以用。Anthropic敢花几千万美元扫实体书,敢赔15亿美元跟作家和解。Google手握搜索、YouTube、Gmail,全世界最大的几座数据矿山就在自己家里。
中国公司呢?
中文互联网的高质量存量内容本来就比英文少。
优质的论坛、博客、专业内容,这几年要么关闭了,要么变成了信息流里的标题党和软文。知乎质量下滑不是新闻了,小红书是生活方式内容多但专业深度内容少,微信公众号的内容封闭在微信生态里想爬也爬不到。
买内容这条路也没那么顺畅。
国内出版社、媒体、作家对AI训练数据的授权还处在非常早期的阶段,没有成熟的商业模式,也没有清晰的定价体系。你想花钱买,都不一定找得到对接的人。
那怎么办?
自己造。
这也是为什么张一鸣敢拍板说不蒸馏。蒸馏别人的模型,短期能追上进度,但长期看你永远在别人后面吃灰,永远不知道数据源头是怎么回事。只有自己从最底层的数据生产、清洗、标注、评测体系开始搭,才有可能真正做出别人没有的东西。
这条路更难,更慢,更烧钱。
但走通了,就是真正的壁垒。
你看今年大模型行业的几个变化就懂了。
年初大家还在比谁的模型榜单分数高,年中开始比谁的Coding能力强、谁的Agent好用。到了下半年,明眼人都看出来了:头部那几家的基础模型能力差不了太多,真正拉开差距的是应用场景,是工程化能力,是你有没有独家的数据飞轮。
不是模型不重要了。
是模型本身已经很难成为绝对壁垒了。
结尾
大模型竞赛打了快4年。
第一阶段拼的是谁敢烧钱买GPU,谁能先把模型跑出来。
第二阶段拼的是谁的应用做得好,谁能找到PMF,谁能把Token变成真金白银的收入。
现在第三阶段开始了。
这个阶段拼的是谁能建立自己的数据供应链。谁能持续生产出别人没有的高质量数据,谁能把数据从"标注外包"变成一套精密运转的工程体系,谁就能在下一轮模型迭代里占得先机。
字节这次把数据部门升到一级,只是掀开了这幕大戏的一角。
接下来你会看到越来越多的公司把数据提升到战略高度。
不是因为他们突然重视数据了。
是因为他们终于发现,GPU有钱就能买,模型有人才就能训,但好数据,是真的要一寸一寸去啃的硬骨头。
咱们等着看。