跳到正文
原文
Hugging Face Blog·· 2020-02-14AI 评分43

Hugging Face 演示使用 Transformers 和 Tokenizers 从头训练新语言模型

How to train a new language model from scratch using Transformers and Tokenizers

AI 导读

Hugging Face 发布教程,演示使用 Transformers 和 Tokenizers 库从头训练 84M 参数的小模型 EsperBERTo。该模型在 3GB 的 Esperanto 语料库上预训练,后续针对词性标注任务进行微调。字节级 BPE tokenizer 训练耗时约 5 分钟,编码序列平均长度比 GPT-2 减少约 30%。

来源:Hugging Face Blog · huggingface.co