大预言模型的基石:Transformer 入坑笔记(二) - 基本原理和 Word Embeddings

背景

继续我们的 Attention Is All You Need 学习之旅。

我不是这个领域的,只是感兴趣想补一下基础,所以这一篇先只看最通用的原理:神经网络训练的大概流程、Embedding 是什么,以及 Word2Vec 里两种常见优化思路。

Attention Is All You Need 最早落在机器翻译任务上,它提出的核心架构就是 Transformer。工程上我们常接触到的 Transformers 库,则是围绕这类模型提供了更完整的封装。