三分之一的新网页疑似由 AI 参与撰写:互联网正在失去原件

BiRun 消息,撰文:小饼 Pew Research Center本周发布了一项基于Common Crawl网络档案的大规模分析。研究团队从2021年1月到2026年7月间的49次网页抓取中,各随机抽样1万个英文网页,合计约49万个页面,然后用一个名为Open Pangram的AI检测模型逐页扫描。 结论可以用两个数字概括。2026年7月的全量快照中,约10%的英文网页呈现出"显著的AI写作或深度编辑迹象"。如果只看ChatGPT发布(2022年11月30日)之后上线的网页,这个比例飙升到35%。 35%这个数字不是说三分之一的互联网由AI写成,因为互联网上沉淀着大量2022年之前的存量页面,但它指向一个清晰的方向: 新增内容里,AI参与正在从例外变成常态。 哪些角落AI含量最高? 分布并不均匀。 .com域名下,约十分之一的页面在2026年的样本中呈现AI写作特征,这个比例是.org域名(4.6%)的两倍多,是.edu和.gov域名(均约1%)的十倍,商业互联网吸收AI的速度远快于学术和政府机构。 Pew的研究还拆解了AI写作的"语言指纹"。 和2023年相比,2026年的新网页中,em dash(破折号)的使用频率翻了一倍,Oxford comma(牛津逗号)增加了63%,AI模型偏爱的词汇(如delve、interplay、tapestry、pivotal)使用量翻了一倍以上,而"it's not just X, it's Y"这种否定并列句式的出现频率接近三倍,这些单独看都不构成定罪证据,但统计聚合后指向一个明确的信号: 新网页的语言纹理正在趋向AI生成文本的特征分布。 更大的图景:读者是谁? Pew的报告关注的是"谁在写",但把它和另一组数据放在一起看,画面变得更完整。 2026年6月3日,Cloudflare CEO Matthew Prince在社交媒体上宣布了一个他自己也没料到会这么快到来的里程碑: AI机器人流量首次超过人类流量,占全球网页HTTP请求的57.4%。 他原本预计这个交叉点会在2027年底出现,实际提前了18个月。HUMAN Security的2026年报告给出了同一方向的数据:2025年全年,AI驱动的自动流量增速是人类流量增速的8倍,其中"代理型AI"(agentic AI,代替用户执行任务的AI)的流量同比增长了近8000%。 把这两件事拼起来:互联网内容的供给侧,三分之一的新增网页由AI参与撰写;需求侧,超过一半的"读者"是机器。一个本来为人类交流而建造的基础设施,正在加速变成机器写给机器看的信息管道。 自我污染循环这不只是一个关于"内容质量下降"的故事,它触及AI行业自身的地基问题。 2024年,Nature发表了一篇来自牛津和剑桥研究团队的论文,证明AI模型在递归训练(用AI生成的数据训练下一代AI)中会出现"模型坍缩"(model collapse):输出逐渐偏离真实世界的数据分布,丢失分布尾部的稀有模式,经过数代迭代后生成越来越同质化甚至无意义的内容。 Epoch AI的研究者预测,适合训练AI的高质量人类原创文本可能在2026到2032年之间耗尽。 循环已经可以描述了:AI模型读取人类互联网,批量生成新网页;新网页被搜索引擎收录,被Common Crawl之类的抓取工具归档;下一代AI模型继续用这些数据训练。每一轮循环,训练数据中"AI写AI"的浓度都在升高,而真正来自人类一手经验的信号在被稀释。 如果互联网的信噪比持续恶化,最先受到冲击的是依赖搜索流量的内容生产者。 搜索结果被同质化的AI改写内容填满,意味着。
利多 查看原文
你怎么看这条消息?来投第一票

评论

0/500
免责声明:本文内容仅供参考,不构成任何投资建议。
更多快讯