
当大模型参数规模从千亿冲向万亿,一个比算力更棘手的问题浮出水面——AI快“没饭吃了”。
据独立研究机构EpochAI测算,语言模型的训练将在2026年到2032年间耗尽人类公开的文本数据。高质量文本数据资产,最快可能在2026年至2030年之间被完全开采一空。更严峻的是,全球50亿大模型数据训练集中,中文语料占比仅为1.3%。英文占全球网络内容近一半,中文却远远落后。这一缺口不仅影响模型的中文理解和生成能力,更限制了中国AI产业的自主发展。
语料短缺之外,版权风险同样高悬。2026年7月,美国加州北区联邦法院批准了Anthropic涉及15亿美元(约合101.5亿元人民币)的版权诉讼和解协议,创下美国版权史上最高纪录。这些作家指控Anthropic未经许可使用其著作训练Claude聊天机器人。与此同时,AI生成内容大量涌入互联网,若不加筛选地循环训练,将引发“模型坍缩”——用复印件去复印复印件,每一代都在丢失信息。
产业界正在行动。2026世界人工智能大会专门设立“语料筑基、智生时代”语料创新论坛,释放出清晰信号:AI的竞争正从“卷参数、卷算力”全面转向“卷数据、卷闭环”。国家数据局数据显示,截至2026年6月,全国已建成高质量数据集超12万个,总体量超1565PB。WAIC2026论坛还提出“数据在闭环”理念,发布语料运营公共服务平台2.0,首创“筛选—转换—合成”三层十级数据进化路线。合成数据、数据闭环等新范式加速落地。
当“数据决定模型上限”成为共识,谁能率先掌握高质量语料与可持续的数据闭环能力,谁就拿到了AI下一阶段的入场券。