
在打造下一代人工智能(AI)模型的高风险竞赛中,中国正进入一个关键新阶段。一个较不显眼,但远远更具存亡意义的威胁正逐渐浮现,那就是高品质训练数据严重短缺。
尽管美国封锁先进运算芯片占据了新闻头条,但中方AI专家却日益警告,事实恐怕会证明,优质数据枯竭,可能成为国家科技雄心的下一个主要瓶颈,而这可能是无法轻易靠硬件替代方案来解决的问题。
事实上,《南华早报》8月8日报导,这挑战正同时冲击太平洋两岸的AI巨头,而部分美国企业已采取积极手段,以保持领先。美国研究机构Epoch AI说,全球高品质、公开可用的人类生成文本供应,可能会在未来6年内耗尽。而OpenAI共同创办人卡帕西(Andrej Karpathy)也警告,2030年结束前,将出现「数据墙」,若没有新鲜可靠的信息喂养,模型能力可能陷入停滞。

美国顶尖实验室正大手笔投资,挖掘线下的人类知识,引发了激烈的伦理争论。今年一月《华盛顿邮报》报导的法庭文件显示,Anthropic在亚马逊公司支持下,启动「巴拿马计划」(Project Panama),斥资数千万美元,收购了数百万本实体书,拆除装订、扫描每一页后,再加以丢弃。
相关揭露引发作家、档案管理员与文化资产保存者的强烈谴责,他们指控科技公司把人类遗产当成可抛弃的原料。Anthropic一名代表本月稍早告诉事实查核网Snopes:「我们的数据获取计划从未购买并销毁『希有』或『古董』书。」

另一方面,对中国来说,即将到来的「数据墙」构成了独特威胁。中国信息通信研究院院长余晓晖便指出:「人工智能创新的竞争,不仅是模型和算力的竞争,更是高质量数据供给体系的竞争。」而网络追踪机构W3Techs本月的数据显示,英文占全球网络内容近一半,中文却仅占1.3%,远远落后西班牙文的6%、德文的5.9%与日文的5%。
北京正积极将数据视为核心战略资产。国家数据局6月公布一项全面的全国性计划,目标是提升高品质AI训练数据的供应、流通与商业化。中方电脑科学家说,国家不能只依赖标准网络爬取,而必须系统性推动数位化庞大、尚未开发的离线资产。中方电脑科学家说,国家不能只依赖标准网络爬取,而必须系统性推动数位化庞大、尚未开发的离线资产。清华大学人工智能研究院常务副院长孙茂松上个月在《光明日报》撰文指出:「语料库在大语言模型发展中扮演关键角色,已演变成支撑AI能力迭代的核心要素。」他并强调,没有语料库,就没有语言大模型。








