前几天看到一个挺有意思的行业动向:几家大模型公司在私下交流时,开始讨论一个越来越紧迫的问题——训练数据不够用了,而且正在快速变差。
具体来说,互联网上的高质量文本,正在被AI生成内容以惊人的速度”稀释”。一个典型例子:Reddit上现在有大量帖子是AI生成的;知乎的某些话题下,AI回答的比例高得吓人;就连一些曾经很权威的技术博客,也开始充斥着”AI优化过的SEO内容”。
这个趋势,对独立博客来说,可能是个意外的好消息。
大模型训练需要海量文本,这已经是常识。但很多人不知道的是,训练数据不是”有字就行”——需要多样化、高质量、有深度、有原创观点的内容。
问题来了:当互联网上的内容越来越同质化、越来越AI味,大模型吃进去的东西质量就会下降。有研究机构做过测算,2024年到2026年之间,可用于大模型训练的高质量互联网文本,增速已经跟不上模型对数据的需求。
这催生了一个新现象:AI公司开始到处”找料”。
有的去买版权内容,比如和出版社、媒体签数据授权协议;有的在推特上发文,用户生成内容就给分成;还有的盯上了独立网站——尤其是那些持续更新、有独特观点、读者互动活跃的独立博客。
说实话,这几年独立博客一直在走下坡路。微信公众号、抖音、小红书把大部分读者的注意力吸走了;剩下来还在写博客的人,要么是真的热爱,要么是写给自己的日志。能靠博客养活自己的博主,少之又少。
但换一个角度看,活下来的独立博客,恰恰是质量最高的。
一个还在更新的独立技术博客,博主往往是在某个领域有实战经验的人。他们的文章不是从文档里复制粘贴的,而是踩过坑、解决过问题之后写出来的经验总结。这种内容,AI生成不出来——至少目前生成不出来。
而且,独立博客的读者虽然少,但黏性极高。一个技术博客的读者,可能一年只来几次,但每次来都是带着具体问题的。这种”精准流量”,对于某些需要高质量数据样本的AI公司来说,比百万泛流量值钱得多。
说到这里,我想提一个有意思的模式延伸。
我之前写过独立博主和Patreon的合作,现在这个模式正在升级。2026年开始,一些数据公司找到独立博主,提出类似这样的合作:“你的内容我授权使用,但你可以选择拒绝被某些特定厂商使用”。
这个变化背后的逻辑是:独立博主开始意识到自己内容的数据价值。而这个价值,在AI时代之前几乎是不存在的——你写一篇博客,除了读者看、搜索引擎收录,几乎没有其他用途。但现在,大模型厂商可能正在后台爬取你的内容,用来训练一个价值数十亿美元的模型,而你一分钱都没拿到。
这公平吗?当然不公平。
所以现在出现了一个趋势:独立博主开始在自己的网站上加声明——比如”本文禁止用于AI训练”或者”非授权爬取视为侵权”。这类声明的法律效力目前还有争议,但至少是一种姿态,也是一种意识的觉醒。
我觉得接下来的几年,独立博客会迎来一个微妙的转折点:
一方面,博客作为内容消费平台的吸引力会继续下降,读者注意力被算法平台吸走是不可逆的;
另一方面,博客作为”高质量内容来源”的价值会开始被发现。这个发现可能来自AI公司,可能来自需要高质量训练数据的新兴AI应用,也可能是某些机构开始重视原创内容的价值。
对于还在坚持写独立博客的朋友,我想说:你们写的东西,比你以为的更值钱。 哪怕只有一百个读者,哪怕没有任何商业变现,那些你一个字一个字敲出来的思考和经验,在AI时代正在变成一种稀缺资源。
当然,这种稀缺性什么时候能变成真金白银,还是一个未知数。但至少,这个方向是值得坚持下去的理由之一。
正在加载评论...