关键知识点

1、GPT和Transformer架构

  1. 人工智能研究实验室OpenAI在2022年11月30日发布的全新聊天机器人ChatGPT,背后的GPT模型就是基于Transformer架构。

  2. GPT:Generative(生成式),Pre-trained(预训练),Transformer(深度学习框架)

  3. 神经网络,全称为人工神经网络(Artificial Neural Network, ANN),是一种受生物神经系统启发而设计的计算模型。它由大量相互连接的节点(或称神经元)组成,旨在模仿人类大脑处理信息的方式。

    1.卷积神经网络(Convolutional Neural Network, CNN):特别适合处理具有网格结构的数据,如图像,广泛应用于计算机视觉领域。
    2.循环神经网络(Recurrent Neural Network, RNN):用于处理序列数据,能够记住过去的信息并将其应用于当前的处理过程中。但是处理的序列不能太长,否则会有遗忘。
    3.长短时记忆网络(Long Short-Term Memory),是一种特殊的循环神经网络(RNN)。LSTM是RNN的改进版本,能更好地捕捉长距离依赖关系,比如语言、视频、股票价格等需要联系上下文的信息。其核心能力:记住重要的,忘记不重要的。
    
  4. Transformer优势

    • 并行计算:Transformer可以充分利用现代计算硬件进行并行计算,大大提高了训练速度。
    • 捕捉长距离依赖:自注意力机制使得每个位置的输入可以与序列中其他位置的所有信息进行交互,这大大增强了模型捕捉长距离依赖的能力。
    • 可扩展性:Transformer架构更容易扩展到更大的模型和更多的数据,也更容易提升模型的表达能力。
    • 灵活性和效果:Transformer不仅能高效地处理长序列,还能够在多种NLP任务中取得良好的效果。无论是机器翻译、文本生成、语义理解,Transformer都能展现出色的性能。
  5. 神经网络的基本单元 — 感知机

    1.神经网络中的基础组件(不严谨,但是可以这么理解)叫“感知机”,可以简单把它理解为一个函数,接收输入,产生输出。输出可以被限定为只能是 0 或 1,也可以限定为是0~1之间的一个数。
    
    2.单隐层神经网络->多层神经网络->深层(深度)神经网络
    
  6. Transformer架构

    1.Transformer架构最初在2017年提出。它是一种基于注意力机制的模型,用于处理序列到序列的任务,如机器翻译、语言建模等。
    
    2.Transformer模型的生成过程可以分为以下4个步骤:
        1.分词(Tokenization)
        2.词嵌入(Embedding)
        3.注意力机制(Attention Mechanism)
        4.最终的内容生成(Content Generation)
    
  7. 大模型中最基本的处理单元 — Token

    一条语句由诸多单词/字(Word)所组成,大模型在进行处理前需要先将语句拆解成一个个的基础单元。
    
    中文:“长沙的雨” → [“长沙”,“的”,“雨”](3 个 Token)
    英文:“Rain in Changsha” → [“Rain”, “in”, “Changsha”](3 个Token)
    句子:“长沙明天暴雨,记得带伞” --> Token列表:[“长沙”,“明天”,“暴雨”,“记得”,“带伞”]
    
    通常 1 个中文词语、1 个英文单词、1 个数字 或 1 个符号计为 1 个 token。注意:不同模型token规则不同。
    
  8. 词向量(Word Vector) ≈ 词嵌入(Word Embedding)

    字、词往往存在远近亲疏关系,人类的语言虽然看起来非常灵活,但这种关系也存在一定的统计规律:
    1.有些字词的使用频率非常高,中文如“的/是/不/能/知道/可以”,英文如“the/to/and/of/in/for/”
    2.某些个字词经常一同出现从而具有特定的意义,如词组、成语、短语、谚语、俗语
    3.某些个字词存在语义上的关系(反义、同义、近义)如 黑与白、高兴与愉快、安静与宁静
    4.同一个字词,在不同的语境下,可能就会具备不同的含义。如“鲜花”和“花钱”中的“花”
    
    还是通过神经网络词嵌入层!利用大规模的语料库进行训练,学习单词之间的语义关系,然后生成每个单词的词向量,向量中每个数字隐含地包含了每个单词和其他单词的某种关联程度。
    国王   初始词向量--->随机生成[-0.12,0.44...]
    国王   语料训练后词向量--->[0.8,0.6,0.3,0.9,0,0,0,…]
    (如“权力,公主”)是人工解释的维度含义,实际词向量的维度是模型自动学习的,没有明确标签。
    每个词的词向量在大模型训练的时候确定,以后则是去查询词向量库。
    专用于输出「词向量」的神经网络模型就是我们所说的嵌入模型。
    
  9. 注意力机制

    1.对大模型来说也是一样的,它需要有能力去捕捉输入文本序列中的每个词汇,在上下文中有怎样的关联,表示怎样的意义。实现这个能力的是大模型的注意力机制。这种「捕捉词语之间的关联」的能力 ——注意力机制(Attention)
    
    2.大模型处理: “天气预报说长沙明天有暴雨”
    Transformer架构会让 “暴雨” 给每个词打分(权重):
    长沙(0.8):强相关(地点)  
    明天(0.7):强相关(时间)
    预报(0.3):弱相关
    其他词(0.1):不相关
    
    3.多头注意力机制
    头 1:关注主谓宾(“长沙→暴雨”)
    头 2:关注时间地点(“明天,长沙→暴雨”)
    头 3:关注信息来源(“天气预报→暴雨”)
    每个头会学到不同的关联模式,算出不同的注意力分数,最后把结果拼起来会得到“总注意力”。
    注意:每个头关注什么维度,其实是为了方便理解。因为准确来说,注意力机制只是计算词之间关联性大小的分数。
    
  10. 为什么向大模型提出”从前有个国王,他有个女儿“,大模型能给一个还不错的回答?我们用这个问题,把前面的概念串起来。

    第一步:拆分,得到Token
    	从前 | 有个 | 国王 | , | 他 | 有个 | 女儿
    第二步:Token到词向量
        「国王」的词向量:[0.8(权力), 0.6(城堡), 0.3(严肃)…]
        「女儿」的词向量:[0.7(公主), 0.5(魔法), 0.4(冒险)…]
    第三步:编码器接收词向量进行处理,结合注意力机制计算关联度
        1.对这句话中的每个词(实际是向量),基于多头注意力机制,使用每个词的词向量去计算这个词在这句话中
        「其他词对我的重要性/关联程度」,比如“女儿”这个词,
        可能的“血缘”维度下:
        「女儿」和「国王」的关联度是 90%,
        「女儿」和「从前」关联度只有 10%
        可能的 “叙事风格” 维度下:
        「女儿」和「国王」的关联度是 85%,
        「女儿」和「从前」关联度是 80%
    	
    	2.计算后,这句话中“女儿”这个词的向量不再是只有原来词向量
        「女儿」= [0.7(公主), 0.5(魔法), 0.4(冒险)…]
        还会多出一个新的向量「女儿新」 ,这个「女儿新」向量中融合了
        「国王」中包含的“权力”、“城堡” 等特征
        以及「从前」中包含的“童话”、“女巫”、“森林”等特征
    	「女儿新」= [0.9, 0.7, 0.6…]
    	
    	3.这句话处理完成后,编码器交给解码器的至少包括:
    	「女儿」= [0.7(公主), 0.5(魔法), 0.4(冒险)…]
    	「女儿新」= [0.9, 0.7, 0.6…]
    
    第四步:交给解码器处理,依然会结合注意力机制
    	怎么续写出来的?解码器接收编码器的输出,不断计算下个词可能是什么,每次都会用注意力机制:
        1、整句所有词的关联关系重新计算
        2、自己已经写的前文中的每个出现的新词(比如:公主、美丽等)也要和已有的词计算关联关系
        结合起来,计算下个词的概率,比如:
        “善良”    出现的概率35% 
        “温柔”    出现的概率30%
        “邪恶”    出现的概率20%
        ………      出现的概率..
        
        解码器续写出:
        从前有个国王,他有个女儿,这位公主
        从前有个国王,他有个女儿,这位公主美丽
        从前有个国王,他有个女儿,这位公主美丽又
        从前有个国王,他有个女儿,这位公主美丽又善良
        从前有个国王,他有个女儿,这位公主美丽又善良………
    
  11. 总结Transformer工作原理步骤:

    1.Token化:把汉字拆成积木(从前 / 国王 / 女儿)
    2.词向量、词嵌入:每个积木的「性格标签」(权力 / 神秘)
    3.编码器处理:分析问题,用注意力划重点(国王和女儿的关系等)
    4.解码器处理:边编故事边查表,用注意力确保连贯,生成内容
    5.不断生成:像玩文字无限接龙,每次参考所有历史信息,用注意力决定下一步重点
    

2、模型训练

  1. 机器学习又包含:监督学习、无监督学习、强化学习

    1、监督学习指的是人们给机器一大堆标记好的数据(比如图片),用标签标记出哪些是三角形、哪些是正方形、哪些是六边形,让机器学习这些数据,在学习的过程中,通过标签检查自己学习的是否正确,学习完成就会归纳出算法或模型,使用该算法或模型判断出其他没有标签的新数据是否是三角形、正方形、六边形。
    
    2、无监督学习(unsupervised learning)指的是人们给机器一大堆没有分类标记的数据,让机器自行对数据分类、检测异常等。
    
    3、强化学习主要用来解决连续决策的问题,强化学习的目标一般是变化的、不明确的,甚至可能不存在绝对正确的标签。
    强化学习可以理解为一种让智能体(比如一个机器人或者一个程序)通过不断尝试和与环境互动来学习如何做出最优决策的方法。根据得到的反馈来调整自己的行为策略,逐渐学会哪些行动能带来更多奖励,哪些行动会带来负激励或者惩罚,从而找到最优的行动方式。
    
    4、自监督学习(Self-Supervised Learning)通过分析数据本身的规律(如局部与整体的关系、不变性特征)来学习。这就是自监督学习的核心 ——用数据自己教自己。自监督学习让机器像孩子一样,通过不断 “解谜” 和 “发现规律” 来理解世界,而不需要人类逐点教授。它是 AI 从 “被动学习” 走向 “主动理解” 的重要一步。
    
    5、对比其他学习方式
    监督学习:就像有个老师指着照片说 “这是猫,那是狗”,你需要记住标签。
    无监督学习:老师只给你照片,说 “把相似的东西归类”,但不告诉你类别名称。
    自监督学习:老师设计了一系列谜题(如 “补全被遮住的部分”),让你在解谜过程中自己发现猫的特征。
    
    6、为什么自监督学习很有用?
        (1)节省成本:不需要雇人标注海量数据(如互联网图片、文本、视频)。
        (2)泛化能力强:模型学会了 “理解” 数据的本质,而不仅是记住标签。例如,预训练的图像模型能识别从未见过的猫品种。
        (3)举一反三:学过 “补全图像” 的模型,也能更好地完成分类、检测等任务,就像你学会了拼图后,看整幅画也更清晰。
    
  2. 大模型的第一阶段:修内功,积累知识(预训练阶段 Pre-training),自监督学习,存在过拟合问题(Overfitting)

  3. 大模型的第二阶段:大佬教教我(监督微调 SFT,Supervised Fine Tuning ),监督学习,Meta 开源了 LLaMA

  4. 大模型的第三阶段:接受审判(基于人类反馈的强化学习 RLHF,Reinforcement Learning from Human Feedback ),强化学习

Logo

魔乐社区(Modelers.cn) 是一个中立、公益的人工智能社区,提供人工智能工具、模型、数据的托管、展示与应用协同服务,为人工智能开发及爱好者搭建开放的学习交流平台。社区通过理事会方式运作,由全产业链共同建设、共同运营、共同享有,推动国产AI生态繁荣发展。

更多推荐