FEATUREDr/LocalLLaMA· rssEN20:23 · 05·27
有人整理了一份1030亿token的Usenet语料,覆盖1980到2013年,全是真人发言、没有AI污染
一个叫OwnerByDane的用户放出了一套从Usenet新闻组扒下来的语料,总规模1031亿token,包含4.08亿条帖子,横跨18347个新闻组,时间从1980年一直拉到2013年。这套数据最大的卖点是“前互联网时代、纯人类产出、零AI生成内容”,对想避开模型训练数据被AI输出污染的开发者来说,算是个稀缺资源。目前可以免费下载每个新闻组层级500...
#Fine-tuning#OwnerByDane#Gemma#Hugging Face
精选理由
精选 · 重要度 76 · 吸引力 + 知识量 + 共鸣
一句话点评
一套1031亿token的纯人类语料,1980-2013年Usenet帖子,零AI污染,对想避开合成数据陷阱的团队是稀缺货。但正文没披露去重和过滤细节,这点先别太激动。
锐评
OwnerByDane放出的这套Usenet语料,核心卖点就一个:干净。1031亿token、4.08亿条帖子,时间跨度从1980年到2013年,正好卡在互联网大规模普及和AI生成内容泛滥之前。对现在被合成数据污染搞怕了的模型训练者来说,这种“纯人类产出”的文本确实有吸引力,尤其适合做基座模型的预训练或者风格微调。
目前每个新闻组层级可以免费下载500条帖子的样本,完整语料需要单独谈授权。但发布帖里没讲清楚几个关键点:去重做到什么程度、有没有过滤掉垃圾广告和重复灌水帖、不同新闻组之间的质量差异有多大。Usenet本身鱼龙混杂,有些组讨论质量很高,有些就是纯吵架,不处理干净直接喂给模型,效果会打折扣。另外1031亿token放在今天不算特别大,大概相当于几套高质量书籍语料的量级,能起多大作用还得看具体怎么用。
如果后续能补上数据处理流程的说明,这套语料的价值会更明确。
HKR 分解
hook ✓knowledge ✓resonance ✓