昊梵体育网

搞LLM数据工程最该学的东西,反倒没人教

阿东最近面实习生,聊到"你做模型时数据怎么处理的",答案清一色:"从HuggingFace下个数据集,清洗了一下就训了。"

清洗了一下。轻飘飘四个字。

但真做过项目就知道:模型工程师80%时间在搞数据,决定模型上限的从来不是网络结构,是数据。

说5个踩坑总结的关键能力:

[一R]数据配比(Data Mixture)是门玄学,但有章法。

代码加多了通用能力降、数学占比高闲聊变生硬。这是大厂最不愿公开的核心机密。先小规模ablation别all-in,领域数据5-20%是安全区。配比错了后面调啥都白搭。

[二R]去重不做,等于花钱让模型背书

重复数据是负资产——过拟合、浪费算力、测试集污染、吐训练原文。三层次:精确去重(hash)、近似去重(MinHash)、子串去重。datasketch / text-dedup直接用。

[三R]质量过滤:垃圾进垃圾出

规则过滤+模型打分+困惑度过滤。2026最大新挑战:过滤AI生成的低质内容——不过滤,你就是在用AI的呕吐物训AI[石化R]。

[四R]合成数据

直接让GPT生成一万条=多样性极差。要多样性优先、质量校验(淘汰30%+正常)、真实数据兜底、拒绝采样。合成数据是放大器,放大方法论也放大错误。

[五R]数据污染检测

benchmark题混进训练集=模型只是背过答案。n-gram重叠检测+训练前去污染+私有holt测。没做污染检测的分数,是用来骗自己和骗老板的。