1. NLP里面的迁移学习

在这里插入图片描述

2. BERT的动机

在这里插入图片描述
在这里插入图片描述

3. BERT框架

在这里插入图片描述

1. 创新
1. 对输入的修改
  1. 当输入为单个文本时,BERT输入序列是特殊类别词元“”、文本序列的标记、以及特殊分隔词元“”的连结。

  2. 当输入为文本对时,BERT输入序列是“”、第一个文本序列的标记、“”、第二个文本序列标记、以及“”的连结。
    在这里插入图片描述

  3. 位置嵌入被加入到输入序列的每个位置。然而,与原始的Transformer编码器不同,BERT使用可学习的位置嵌入。

  4. segment embedding用来区分句子。
    在这里插入图片描述

2. 预训练
1. 带掩码的语言模型
  1. BERTEncoder的前向推断给出了输入文本的每个词元和插入的特殊标记“”及“”的BERT表示。接下来,我们将使用这些表示来计算预训练BERT的损失函数。
    在这里插入图片描述

  2. 为了双向编码上下文以表示每个词元,BERT随机掩蔽词元并使用来自双向上下文的词元以自监督的方式预测掩蔽词元。

在这里插入图片描述

2. 下一句预测

在这里插入图片描述

  1. 。在为预训练生成句子对时,有一半的时间它们确实是标签为“真”的连续句子;在另一半的时间里,第二个句子是从语料库中随机抽取的,标记为“假”。

4. 小结

  1. • word2vec和GloVe等词嵌入模型与上下文无关。它们将相同的预训练向量赋给同一个词,而不考虑词的上下文(如果有的话)。它们很难处理好自然语言中的一词多义或复杂语义。

  2. • 对于上下文敏感的词表示,如ELMo和GPT,词的表示依赖于它们的上下文。

  3. • ELMo对上下文进行双向编码,但使用特定于任务的架构(然而,为每个自然语言处理任务设计一个特定的体系架构实际上并不容易);而GPT是任务无关的,但是从左到右编码上下文。

  4. • BERT结合了这两个方面的优点:它对上下文进行双向编码,并且需要对大量自然语言处理任务进行最小的架构更改。

  5. • BERT输入序列的嵌入是词元嵌入、片段嵌入和位置嵌入的和。

  6. • 预训练包括两个任务:掩蔽语言模型和下一句预测。前者能够编码双向上下文来表示单词,而后者则显式地建模文本对之间的逻辑关系。

在这里插入图片描述

5. 微调

在这里插入图片描述
在这里插入图片描述

1. 句子分类

在这里插入图片描述

2. 命名实体识别

在这里插入图片描述

在这里插入图片描述

3. 问题回答

在这里插入图片描述
在这里插入图片描述
在这里插入图片描述

Logo

魔乐社区(Modelers.cn) 是一个中立、公益的人工智能社区,提供人工智能工具、模型、数据的托管、展示与应用协同服务,为人工智能开发及爱好者搭建开放的学习交流平台。社区通过理事会方式运作,由全产业链共同建设、共同运营、共同享有,推动国产AI生态繁荣发展。

更多推荐