论文解读之GPT1:Improving Language Understanding by Generative Pre-Training

近期会整理经典的大模型架构和其具体训练、数据过程,从GPT1开始

一、介绍

GPT系列的特点是自监督大规模训练后在具体任务上进行有监督微调,事实证明这种方式可以有效利用大规模的无标签语料以提升模型对于自然语言的理解力,即使其调整参数以记忆足够多知识的模型

结构类似于llama,为多层的decoder-only:

二、训练

2.1 无监督预训练

即,最大化根据之前位置正确的token生成当前位置正确token的对数概率

以下的公式清晰展示了输入在这个模型中的处理流程以及概率输出:

文本被token化后,进过输入的token embedding 矩阵映射后,加上位置编码,接着经过n层decoder块的处理后,softmax转化为词表大小的概率输出

2.2 有监督微调

对于有标签训练,加了一个输出的映射层,这个层负责从transformer的docoder块输出的向量中映射到标签的空间,有监督的损失与无监督类似:

在有监督训练阶段,加入

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值