LAYER 02 / DATA ENGINEERING
数据治理
让原始数据成为可信、可追溯的学习信号。
去重 · 数据质量 · Tokenizer · 8 篇笔记0102030405060708
数据来源、许可与经验分布
训练数据为何定义了模型所拟合的世界分布与合法边界。
10 分钟阅读文本解析、规范化与基础清洗
原始网页、文档和日志怎样变成含义尽量不失真的训练文本。
11 分钟阅读去重:精确去重、MinHash 与语义去重
怎样减少重复训练、评测泄漏和模板化数据带来的偏置。
13 分钟阅读质量过滤、数据配比与课程学习
不同来源和难度的数据怎样共同决定模型能力与遗忘。
13 分钟阅读标注、偏好数据与人类反馈
示范、成对偏好和过程标注怎样形成后训练数据。
14 分钟阅读隐私、脱敏与数据安全
数据进入训练或检索前怎样降低个人、机密和受限信息风险。
12 分钟阅读数据版本、血缘与污染控制
怎样知道一个样本来自哪里、经过何种变换,以及是否污染评测。
11 分钟阅读Tokenizer、样本格式与 Packing
文本怎样变成 token ID、训练样本和 loss mask。
13 分钟阅读