Note: This page does not support English, using the default language version
6月22日,《新科学家》杂志刊发了一篇调查报道,多名匿名举报人证实了一个让人哭笑不得的事实:受雇于Scale AI、Outlier等数据标注平台的工作人员,正在用ChatGPT来完成”提供高质量人类数据”的任务。
你没看错。那些本应该由人类亲手标注、用来训练下一代AI的”高质量数据”,很可能就是上一代AI生成的。
用AI训练AI,这已经不是科幻——它正在发生,而且规模远超你的想象。
Scale AI 估值一度冲到140亿美元,它的核心业务很简单:为AI公司提供”人类标注数据”。不管是GPT、Claude还是Gemini,它们的训练数据里都有Scale AI标注的内容。
这些标注任务包括:判断两个句子的语义是否相似、给图片打标签、评估AI回复的质量……本质上,就是在替AI”定义什么是好的”。
但问题是,这些活儿大部分发给了低收入国家的自由职业者,单价极低。为了效率,不少人开始”借助工具”——而这个工具,就是ChatGPT本身。
《新科学家》的报道里,一位曾在Outlier(Scale AI旗下平台)工作的标注员坦承:他会把需要”从人类角度评价AI回复”的任务,直接丢给ChatGPT,然后把ChatGPT的回答当作”人类标注结果”提交。
这就像一个学生让同桌代写作文,然后告诉老师这是自己写的。
你可能会想:反正都是英文,ChatGPT写的答案和人类写的答案,差别能有多大?
差别很大。
AI生成的内容有一个隐蔽的问题:它倾向于”平均”。ChatGPT给出的回答,往往是”最像正确答案”的答案,而不是”最有人类特色”的答案。如果你用ChatGPT来标注”什么是一个好的中文回复”,那训练出来的模型会越来越像ChatGPT,而不是越来越像人类。
这叫模型坍缩(Model Collapse)。简单来说,就是AI训练AI,一代比一代差,最终陷入一个越来越窄的分布里,失去多样性。
2023年,牛津和剑桥的研究者就在一篇论文里警告过这个问题。当时还停留在理论推演。现在看来,它已经在发生了。
知道。而且一直是睁一只眼闭一只眼。
Scale AI的标注平台上有大量任务,本质上是在”利用人类智慧来让AI变得更聪明”。但如果人类本身就在用AI来完成这些任务,整个数据管线就变成了一个笑话。
更讽刺的是,一些AI公司已经开始用”AI检测工具”来筛查标注数据。但如你所知,AI检测工具本身就不准——这就变成了一个套娃:用不靠谱的AI工具,来检测用AI造假的标注数据。
说实话,作为普通用户,我们能做的有限。但有几件事值得注意:
第一,对AI生成的内容保持警惕。 不是说AI内容不能用,而是要知道它的局限性。AI擅长”平均答案”,不擅长”创造性突破”。
第二,支持那些有明确数据透明度的AI产品。 有些公司会公开说明训练数据的来源和质量控制措施,这些公司值得信任。
第三,如果可以,贡献你的”人类数据”。 一些开源项目(比如Hugging Face上的数据集)会征集人类标注,这些是真的在认真做数据质量的。
这件事最让人感慨的地方在于:我们费了这么大劲想造出一个”像人类一样思考的AI”,结果连”教AI理解人类”这件事,都在被AI偷偷替代。
不知道这算进步,还是算荒诞。
但有一件事是确定的:当整个行业都在追求”更大、更快、更便宜”的时候,谁愿意慢下来,认真做数据质量,谁才可能走得更远。
Loading comments...