大语言模型系列-ELMo-Toy模板网

这篇具有很好参考价值的文章主要介绍了大语言模型系列-ELMo。希望对大家有所帮助。如果存在错误或未考虑完全的地方，请大家不吝赐教，您也可以点击"举报违法"按钮提交疑问。

前言

在前文大语言模型系列-word2vec已经提到word2vec的缺点：

为每个词汇表中每个分词静态生成一个对应的词向量表示，没有考虑到语境，因此无法无法处理多义词

ps：先训练一个词嵌入模型，生成词向量表示，然后将生成的词向量输入下游任务新的模型中进行具体NLP任务训练，由于下游任务不再需要使用这些词嵌入模型，因此整个过程计算效率方面通常非常低，如Skip-Gram和GloVe。

ELMo对上述缺点进行了改进。

提示：以下是本篇文章正文内容，下面内容可供参考

一、ELMo的网络结构和流程

基于ELMo的NLP任务分为两个阶段：

第一个阶段是预训练，使用在大规模语料库上训练好的Word Embedding，输入ELMo模型中进行预训练
第二个阶段是在做下游任务时，从预训练网络中提取对应单词的网络各层的词嵌入作为新特征补充到下游任务中

ps：由此可以看出ELMo是一种典型的基于特征融合的预训练模型。

具体的应用流程如下：

将句子输入ELMo网络中，这样句子中每个单词在ELMo网络中都能获得对应的三个Embedding；
赋予每个Embedding一个权重（这个权重可以由学习得来），然后通过加权求和将三个Embedding整合为一个；
将整合后的Embedding作为相应的单词输入，作为新特征给下游任务使用

大语言模型系列-ELMo,LLM,语言模型,人工智能,自然语言处理,深度学习,迁移学习

二、ELMo的创新点

采用多层的Bi-LSTM网络以捕捉不同层次的特征
通过将token与word embedding对应，可以针对不同的上下文生成不同的词向量

ps：ELMO 的本质思想是：事先用语言模型学好一个单词的 Word Embedding，此时多义词无法区分，不过这没关系。在实际使用 Word Embedding 的时候，单词已经具备了特定的上下文了，这个时候我可以根据上下文单词的语义去调整单词的 Word Embedding 表示，这样经过调整后的 Word Embedding 更能表达在这个上下文中的具体含义，自然也就解决了多义词的问题了。所以 ELMO 本身是个根据当前上下文对 Word Embedding 动态调整的思路。