作者对BERT的预训练进行了仔细的评估,包括 超参数 和训练集大小的配置,发现BERT其实没有很充分地训练,从而提出了更好地训练BERT的方法,称为RoBERTa,它超过了在BERT之后发表的所有post-BERT方法的效果。 方法其实很简单: 同时作者总结了一下文章的主要贡献: 展示了一组重要的BERT的设计选择和新的训练策略,使模型在下游任务上取得更好的效果。 模型细节. RoBERTa同样使用了Adam,β1为0.9,β2为0.999,ε=1e-6,L2 weight decay为0.01,全部层的dropout为0.1, 线性激活 为GELU。

