知识库 / 数据治理
GitHub
← 返回知识地图

LAYER 02 / DATA ENGINEERING

数据治理

让原始数据成为可信、可追溯的学习信号。

去重 · 数据质量 · Tokenizer · 8 篇笔记
01

数据来源、许可与经验分布

训练数据为何定义了模型所拟合的世界分布与合法边界。

10 分钟阅读
02

文本解析、规范化与基础清洗

原始网页、文档和日志怎样变成含义尽量不失真的训练文本。

11 分钟阅读
03

去重:精确去重、MinHash 与语义去重

怎样减少重复训练、评测泄漏和模板化数据带来的偏置。

13 分钟阅读
04

质量过滤、数据配比与课程学习

不同来源和难度的数据怎样共同决定模型能力与遗忘。

13 分钟阅读
05

标注、偏好数据与人类反馈

示范、成对偏好和过程标注怎样形成后训练数据。

14 分钟阅读
06

隐私、脱敏与数据安全

数据进入训练或检索前怎样降低个人、机密和受限信息风险。

12 分钟阅读
07

数据版本、血缘与污染控制

怎样知道一个样本来自哪里、经过何种变换,以及是否污染评测。

11 分钟阅读
08

Tokenizer、样本格式与 Packing

文本怎样变成 token ID、训练样本和 loss mask。

13 分钟阅读

输入关键词,探索整个知识库

↑ ↓ 选择 ↵ 打开36 篇笔记,一次搜索