NLP学习-Task 4: Contextual Word Embeddings

最新推荐文章于 2022-04-29 00:55:23 发布

iiVax

最新推荐文章于 2022-04-29 00:55:23 发布

阅读量911

点赞数

CC 4.0 BY-SA版权

文章标签：自然语言处理深度学习神经网络机器学习

本文链接：https://blog.csdn.net/weixin_43968103/article/details/107051707

本文介绍了Contextual Word Embeddings，重点讲解了ELMo和GPT模型。ELMo利用Bi-LSTM模型生成深度情境化词表征，适合语义理解和语法分析。GPT则采用预训练的Transformer结构，通过无监督学习和有监督微调适应各种NLP任务。这两种模型在NLP领域展现出强大的性能。

摘要生成于 C知道，由 DeepSeek-R1 满血版支持，前往体验 >

NLP学习

更新流程↓
Task 1: 简介和词向量Word Vectors
Task 2: 词向量和词义Word Senses
Task 3: 子词模型Subword Models
Task 4: Contextual Word Embeddings
Task 5: 大作业
 日本人综艺感从昭和时代开始就这么强了吗？
今日份的舒适
 常见餐桌礼仪

Contextual Word Embeddings

文章目录

1. ELMo

Allen实验室认为好的词表征应该同时兼顾两个问题：一是单词在语义和语法上的复杂特点；二是随着语言环境的改变，这些用法也应该随之变化。
为此，Allen实验室提出了deep contextualized word representation（深度情景化词表征）。这种算法的特点是每个词的表征都是整个输入语句的函数。

具体做法：

现在大语料上以 language model为目标训练处 Bi-LSTM模型，利用它产生词语的表征 （pre-trained biLM模型）。ELMo因此得名embedding from language model。
为了应用在下游NLP任务中，一般先利用下游任务的语料库（此时，忽略掉label）进行 language model的微调（fine tuning），这种微调相当于一种domain transfer。
然后才是利用label的信息进行supervised learning。

ELMo表征是“深”的，就是说它们是biLM的所有层的内部表征的函数。这样做的好处是能够产生丰富的词语表征。高层的LSTM的状态可以捕捉词语意义中和语境相关的那方面的特征(比如可以用来做语义的消歧)，而低层的LSTM可以找到语法方面的特征(比如可以做词性标注)。如果把它们结合在一起，在下游的NLP任务中会体现优势。

在这里插入图片描述

1.1. Bidirectional language models

ELMo顾名思义是从Language Models得来的embeddings，确切的说是来自于Bidirectional language models。具体可以表示为：
$p(t_1,t_2,...,t_N)=\prod_{k=1}^{N}p(t_k|t_1,t_2,...,t_{k-1})和p(t_1,t_2,...,t_N)=\prod_{k=1}^{N}p(t_k|t_{k+1},t_{k+2},...,t_N)$