DistilBERT:用蒸馏把 BERT 做小做快
DistilBERT 在预训练阶段蒸馏 BERT,得到 6 层、参数少 40% 的模型,推理约快 60%,并保留 BERT-base 约 97% 的 GLUE 成绩。
机构
同名开源机器学习平台背后的公司,以 Transformers 库、模型与数据集 Hub,以及 SmolLM 小模型系列等连同数据完全开源的发布而闻名。
DistilBERT 在预训练阶段蒸馏 BERT,得到 6 层、参数少 40% 的模型,推理约快 60%,并保留 BERT-base 约 97% 的 GLUE 成绩。
SmolLM2 是 1.7B 小模型,约 11T token 分四阶段过量训练。HellaSwag 68.7、MMLU-Pro 19.4 胜过 Llama3.2-1B,且四套数据集一起开源。