Whole Word Masking 翻译成全词Mask,是一种预训练阶段的训练样本生成策略。最原始的分词方式是基于WordPiece子词,它会把完整的一个词切分成若干个子词,在生成训练样本时,这些被分开的子词会随机被Mask。在全词Mask中,如果一个完整的词的部分WordPiece子词被mask,则同属该词的其他部分也会被mask。
这里的mask是一种策略,并非仅仅指单词被替换成[mask]标签。
标签:Word,mask,Mask,Masking,Whole,子词 From: https://www.cnblogs.com/AudreyXu/p/17187394.html