<七>从3秒记忆到过目不忘——语言模型的三代进化

发布时间:2026/8/20 2:58:52

<七>从3秒记忆到过目不忘——语言模型的三代进化
上篇https://www.cnblogs.com/webor2006/p/22389647学了语言模型是什么——就是对下一个词出现的概率进行数学建模。但这事说起来简单做起来一点都不简单。怎么建这个模计算机怎么记住前面说过的话这篇看看语言模型是怎么一步一步从只能记住 3 个词进化到能理解整本书的。一、第一代N-gram 模型(1990年代-2000年代)最早的语言模型非常朴实叫N-gram 模型(1990年代-2000年代的主流)。它的思路简单到粗暴预测下一个词只看前面 N-1 个词。公式也很直接大白话解释一下P(下一个词 | 前一个词) 前一个词和下一个词一起出现的次数 / 前一个词出现的次数比如一个 2-gram 模型(只看前 1 个词)如果训练数据里 猫会 后面是 爬树 —— 出现了 500 次 猫会 后面是 抓老鼠 —— 出现了 300 次 猫会 后面是 飞 —— 出现了 2 次 ​ 那模型就记住了P(爬树|猫会) P(抓老鼠|猫会) P(飞|猫会)听起来挺合理的对吧但问题很快就来了。想象这个句子昨天下午我去超市买了一堆东西结账的时候发现忘带钱包了尴尬得不行。回到家才发现其实口袋里一直有______要填这个空你得知道前面说的是忘带钱包不是没带钱——钱可能在口袋。但 N-gram 只看前面 2~3 个词它只能看到一直有根本不知道前面在说忘带钱包的事。就像一个记忆只有 3 秒的人你跟他说了 10 句话他只记得最后半句。理解不了复杂的对话说两句就跑偏。二、第二代RNN/LSTM(2010年代早期)为了解决记不住的问题研究者搞出了RNN(循环神经网络)。RNN 的核心创新是加了一个隐藏状态——可以理解为模型边读边做笔记。每读一个词就更新一下笔记。理论上只要笔记记得好它就能记住整个历史。但实际上呢信息在传递过程中会衰减。每经过一层信息都要乘以一个小于 1 的系数(比如 0.9)传 1 层后0.9^1 0.9 → 还剩 90% 传 10 层后0.9^10 ≈ 0.35 → 只剩 35% 传 100 层后0.9^100 ≈ 0.00003 → 几乎没了就像传话游戏——十个人排成一排传一句话第 1 个人今晚去万达吃火锅记得带充电宝和优惠券 第 2 个人今晚去万达吃火锅记得带充电宝 ← 优惠券丢了 第 3 个人今晚去万达吃火锅 ← 充电宝也丢了 第 5 个人今晚去吃火锅 ← 万达没了 第 10 个人今晚吃饭 ← 只剩俩字传着传着信息就消失殆尽了。为了解决这个问题又搞出了LSTM(长短期记忆网络)。它加了三个门遗忘门哪些旧信息可以忘了输入门哪些新信息值得记住输出门当前应该关注什么就像你听课做笔记——你不会把老师说的每个字都记下来。你会判断哪个是重点(输入门)哪个可以划掉(遗忘门)哪些要画星号(输出门)。这一搞把记忆从 10~20 个词提升到了 100~200 个词。就像一个记忆从 3 秒变成 20 分钟的人——能看懂一集动漫了但一部两小时的电影还是不行。三、第三代Transformer(2017年至今)2017 年Transformer横空出世。它用一种叫Self-Attention(自注意力)的机制彻底解决了记不住的问题。这里先建个框架Transformer 和 Self-Attention 后面会单独拆开细学现在有个整体印象就行。以前的模型是传话模式——信息一个接一个往后传传着传着就丢了。Transformer 把模式改了不传话了所有人围着一张圆桌坐下你想跟谁说话直接说每个人都听得到每个人。就像一个圆桌会议。A 说昨天我在公园遇到了老张B 说他看起来很开心C 说他在上海工作——不管谁说、说什么、离你多远你全能直接听到。不需要中间人转述。Transformer 更厉害的地方在于它不仅让所有词互相听到还能让每个词智能地关注重点。比如要预测老张__——模型会自动把注意力分配给开心(情绪线索)、上海(地点线索)、公园(场景线索)、老张(指代对象)。它能同时抓住多个维度的信息综合判断。具体来说当模型处理老张这个词时它对前面各个词的注意力分配大概是这样的老张对各个词的注意力权重 ────────────────────────── 昨天 2% ← 不太相关 公园 5% ← 场景线索 遇到了 3% 老朋友 8% 老张 65% ← 指代对象高度相关 上海 5% ← 地点线索 工作 7% 很开心 5% ← 情绪线索 ──────────────────────────它不会只盯着一个词而是从多个维度同时抓取信息综合起来做出判断。这就是为什么 ChatGPT 能记住几万字的上下文——因为它站在 Transformer 的肩膀上从传话游戏变成了圆桌会议。GPT-4 支持 128,000 个 token 的上下文靠的就是这层能力。Self-Attention 有四个核心优势无损传递任意两个词之间直接连接不需要中间人转述智能筛选自动计算哪些词重要把注意力放在关键位置并行计算所有词可以同时处理不像 RNN 必须一个一个来无限长度(理论上)不管句子多长每个词都能直接看到所有其他词ChatGPT 就是基于 Transformer 的语言模型。从传话到群聊这不只是技术升级是范式的革命。四、大语言模型为什么非得这么大经常听到大语言模型(LLMLarge Language Model)这个词。这个大到底是什么意思大就是参数多。来看一组数字GPT-1 (2018): 1.17 亿参数 GPT-2 (2019): 15 亿参数 GPT-3 (2020): 1750 亿参数 GPT-4 (2023): 约 1.8 万亿参数 GPT-4o (2024): 约 1.8 万亿参数 GPT-5 (2025): 约 2 万亿参数从 GPT-1 到 GPT-5参数增长了约17000 倍。光是从 GPT-1 到 GPT-3仅仅两年时间参数就涨了约 1500 倍。这还不算训练数据——GPT-2 读过约 40GB 文本(相当于 80 本百万字小说)GPT-3 读了 570GB(1140 本)GPT-4/5 的具体数据没有公开但只会更大。除了 OpenAI这两年大家比较熟悉的还有这些DeepSeek-V3 (2024): 6710 亿参数(MoE 架构激活 370 亿) DeepSeek-V4-Flash: 未公开参数速度更快 Qwen2.5 (2024): 720 亿参数(阿里通义千问) Google Gemini 3 (2025): 1 万亿参数 Claude 4 (Anthropic, 2025): 约 1.5 万亿参数DeepSeek 可能大家印象最深——2025 年初那波热度让很多人都知道了国产大模型也能做到世界一流水平。为什么要这么大因为上篇学的那个大力出奇迹效应规模达到某个临界点后能力会突然跃升。不是大一点好一点的线性增长而是过了某个坎模型突然就会了——这种现象叫涌现能力。后面会专门学到这里先有个印象。所以大不是虚荣是必需。没有这个大就没有 ChatGPT 的智能。那多大算大行业里有个约定俗成的分界线小语言模型(SLM小于 100 亿参数)如 ChatGLM-6B、Mistral-7B、LLaMA-2-7B轻量级能在个人电脑或手机上跑中型(100 亿~1000 亿)如 LLaMA-2-70B、Qwen-72B需要多块 GPU但仍能本地部署大语言模型(LLM大于 1000 亿)如 GPT-3/4/5需要巨型计算集群通常只能通过云服务访问这个区分决定了能力边界也决定了用在哪儿对于 ChatGPT 来说它确实是一个大语言模型。不过有个有意思的趋势小而精正在崛起。以前觉得模型越大越好但最近发现小模型也可以很强。比如 Qwen2.5-7B 在很多任务上表现不输大模型手机就能跑Llama-3.2-3B 只有 30 亿参数日常问答也够用了。这说明大不是唯一的路。更好的训练方法、数据质量、模型架构同样重要。未来大概率是大小共存大模型做通用智能助手小模型做手机端、隐私敏感场景的专用任务。五、GPT 和 ChatGPT不是一个东西最后学一个容易搞混的点。GPT 是模型ChatGPT 是产品。GPT-1、GPT-2、GPT-3、GPT-3.5、GPT-4、GPT-4o、GPT-5——这些是技术名称指的是基础语言模型。它们只经过预训练核心能力就是预测下一个词只会接龙。参数规模从 1.17 亿一路涨到 2 万亿数据量从 40GB 涨到不敢公开但本质没变——都是下一个词预测器。如果你直接问 GPT-3怎么做红烧肉它可能这样接——怎么做红烧肉这个问题很多人问过。首先你需要准备五花肉……或者怎么做红烧肉我也不知道我从来没做过饭……它只是在接龙不知道你在提问不知道要给出答案。为什么会这样因为纯语言模型的训练目标只有一个——预测下一个词。它在海量互联网文本里见过各种开头有文章以怎么做红烧肉这个问题……开头有论坛帖子是怎么做红烧肉我也不知道……有网页列举怎么做红烧肉怎么……它把输入当成一篇文章的开头顺着往下写。它不知道你在问问题也不知道要给出答案。而 ChatGPT(对话模型)会这样回应做红烧肉可以参考以下步骤准备食材五花肉 500g、冰糖、八角、桂皮、生抽、老抽、料酒焯水五花肉切块冷水下锅加姜片和料酒煮开后撇去浮沫捞出备用炒糖色锅里放少许油加冰糖小火慢炒炒到琥珀色时下肉块翻炒上色炖煮加生抽、老抽、八角、桂皮倒入热水没过肉大火烧开转小火炖 40 分钟收汁开大火收汁汤汁浓稠后出锅你是第一次做吗要不要我讲得再细一点它理解了你在提问知道要给出结构化的步骤甚至还会反问引导对话继续。ChatGPT 不一样。ChatGPT 不是模型名是产品名。它的公式是ChatGPT 基础模型 对话训练举个具体的例子就清楚了早期 ChatGPT GPT-3.5 对话训练后来 ChatGPT GPT-4 对话训练现在 ChatGPT GPT-4o/GPT-5 对话训练同一个公式换不同的基础模型就是不同时期的 ChatGPT。但这个对话训练到底包含什么拆开来看是两个步骤SFT(监督微调)拿人工标注的问题-标准答案数据来训练让模型学会问答模式RLHF(人类反馈强化学习)让人给模型的多个回答打分排序再用强化学习优化让输出更符合人类偏好后面会细学这两个步骤现在知道它们的存在就行。简单说GPT 只会接龙ChatGPT 学会了聊天。产品化的最后一公里比技术突破更重要。这篇学了语言模型的三代进化。N-gram 只能看前面几个词RNN/LSTM 能记 100~200 个词但信息会衰减Transformer 用 Self-Attention 彻底解决了记忆问题。模型做大之后参数从 1 亿到 2 万亿新的能力自己冒出来。最后容易搞混的一点GPT 只会接龙ChatGPT 是加了对话训练之后才会聊天的。下一篇见加油

相关新闻

双极型晶体管工作原理:从PN结到放大电路设计

双极型晶体管工作原理:从PN结到放大电路设计

2026/8/20 2:58:52

1. 从“开关”到“放大器”:双极型晶体管的本质是什么?如果你拆开任何一个老式的收音机、一个经典的模拟音频放大器,甚至是你家空调的遥控器,大概率会在电路板上看到一些黑色的小方块,上面印着“2N2222”、“S8050”或…

手把手教你为WorkBuddy接入火山云Ark免费大模型,解锁12种AI编程能力

手把手教你为WorkBuddy接入火山云Ark免费大模型,解锁12种AI编程能力

2026/8/20 2:48:51

在 AI 助手工具百花齐放的今天,很多开发者都希望将强大的大模型能力集成到自己的开发工作流中,以提升编码、调试和问题解决的效率。WorkBuddy 作为一款备受关注的 AI 编程助手,其开放性和可扩展性是其核心优势之一。然而,很多用户…

基于ESP32与BME280的物联网气象站:从硬件到云端的全栈实践

基于ESP32与BME280的物联网气象站:从硬件到云端的全栈实践

2026/8/20 2:48:51

1. 项目概述:从“猫头鹰气压计”说起最近在捣鼓一个挺有意思的小玩意儿,我管它叫“Owl Barometer”,直译过来就是“猫头鹰气压计”。这名字听起来有点玄乎,其实内核很实在:它是一个集成了环境传感器(主要是…

ATOD:攻克多轮智能体任务蒸馏难题的退火轮次感知在线策略蒸馏

ATOD:攻克多轮智能体任务蒸馏难题的退火轮次感知在线策略蒸馏

2026/8/20 3:48:54

1. 从“单步”到“多轮”:智能体任务蒸馏的挑战与机遇最近在折腾大语言模型驱动的智能体时,我遇到了一个非常具体且棘手的问题:如何让一个“学生”模型,高效地学会一个“老师”模型在多轮、复杂决策任务中的全部本事?这…

编码器原理与选型实战:从光电/磁电原理到PLC/单片机信号读取

编码器原理与选型实战:从光电/磁电原理到PLC/单片机信号读取

2026/8/20 3:48:54

在工业自动化、机器人控制、精密测量等领域,电机编码器扮演着“眼睛”和“尺子”的关键角色。无论是伺服电机精准定位、数控机床的精密加工,还是机器人关节的角度反馈,都离不开编码器的实时数据。然而,面对增量式、绝对值、磁编码…

2365、STM32单片机智能手环便携式腕戴式心率血氧监测仪报警设计(程序+原理图+PCB文件+系统硬件框图+程序流程图+器件清单等)

2365、STM32单片机智能手环便携式腕戴式心率血氧监测仪报警设计(程序+原理图+PCB文件+系统硬件框图+程序流程图+器件清单等)

2026/8/20 3:48:54

目录 一、设计功能 二、实物图 三、原理图 四、PCB图 五、程序源码 资料包括: 一、设计功能 1,系统通过STM32F103C8T6单片机进行控制 2,通过MAX30120传感器进行采集心率和血氧,将心率和血氧显示在OLED显示屏上 3&am…

博世2017财报解析:百年工业巨头的数字化转型与业务协同之道

博世2017财报解析:百年工业巨头的数字化转型与业务协同之道

2026/8/20 3:48:54

1. 从一份财报看一家百年巨头的转型韧性又到了财报季,各大企业纷纷亮出成绩单。今天想和大家聊聊一份2017年的“旧闻”——博世集团当年销售额和利润实现大幅增长。乍一看,这只是一条普通的财经快讯,但如果你把它放在一个更长的历史周期和更复…

基于ESP32的便携式电磁场检测仪:从传感器原理到物联网实践

基于ESP32的便携式电磁场检测仪:从传感器原理到物联网实践

2026/8/20 3:48:54

1. 项目概述:用ESP32打造一台便携式电磁场检测仪如果你对身边的隐形电磁场感到好奇,或者想亲手制作一个能探测电器漏磁、评估环境电磁辐射水平的工具,那么这个基于ESP32 Feather开发板的EMF Meter项目绝对值得一试。我把它称为Mk09版本&#…

微服务拆分实战指南:从评估到落地的四步策略与避坑清单

微服务拆分实战指南:从评估到落地的四步策略与避坑清单

2026/8/20 3:38:53

1. 这篇文章真正要解决的问题“车技不好,不要乱挑战”——这句话听起来像是老司机的忠告,但在技术世界里,它指向了一个更普遍、也更隐蔽的问题:技术能力与系统复杂度的错配。很多开发者,尤其是刚接触新框架、新架构或分…

【文章复现】非线性值迭代自适应动态规划(ADP):离散时间非线性系统的策略迭代自适应动态规划算法研究附Matlab代码

【文章复现】非线性值迭代自适应动态规划(ADP):离散时间非线性系统的策略迭代自适应动态规划算法研究附Matlab代码

2026/8/19 3:36:59

✅作者简介:热爱科研的Matlab仿真开发者,擅长毕业设计辅导、数学建模、数据处理、建模仿真、程序设计、完整代码获取、论文复现及科研仿真。🍎 往期回顾关注个人主页:Matlab科研工作室👇 关注我领取海量matlab电子书和…

【双层规划,节点出清价,绿证交易,CVaR方法】两级电力市场环境下计及风险的省间交易商最优购电模型附Matlab代码

【双层规划,节点出清价,绿证交易,CVaR方法】两级电力市场环境下计及风险的省间交易商最优购电模型附Matlab代码

2026/8/19 9:17:18

✅作者简介:热爱科研的Matlab仿真开发者,擅长毕业设计辅导、数学建模、数据处理、建模仿真、程序设计、完整代码获取、论文复现及科研仿真。🍎 往期回顾关注个人主页:Matlab科研工作室👇 关注我领取海量matlab电子书和…

隐式mpc+自适应mpc+时变mpc,线性时变模型预测控制附Simulink仿真

隐式mpc+自适应mpc+时变mpc,线性时变模型预测控制附Simulink仿真

2026/8/19 8:02:16

✅作者简介:热爱科研的Matlab仿真开发者,擅长毕业设计辅导、数学建模、数据处理、建模仿真、程序设计、完整代码获取、论文复现及科研仿真。🍎 往期回顾关注个人主页:Matlab科研工作室👇 关注我领取海量matlab电子书和…

微信聊天记录如何完整导出?WeChatMsg备份指南:HTML/Word/CSV一键转换

微信聊天记录如何完整导出?WeChatMsg备份指南:HTML/Word/CSV一键转换

2026/8/20 0:08:45

微信聊天记录如何完整导出?WeChatMsg备份指南:HTML/Word/CSV一键转换 【免费下载链接】WeChatMsg 提取微信聊天记录,将其导出成HTML、Word、CSV文档永久保存,对聊天记录进行分析生成年度聊天报告 项目地址: https://gitcode.com…

B站缓存m4s打不开?m4s-converter无损合成MP4,实测1.46GB仅5秒

B站缓存m4s打不开?m4s-converter无损合成MP4,实测1.46GB仅5秒

2026/8/20 0:08:45

B站缓存m4s打不开?m4s-converter无损合成MP4,实测1.46GB仅5秒 【免费下载链接】m4s-converter 一个跨平台小工具,将bilibili缓存的m4s格式音视频文件合并成mp4 项目地址: https://gitcode.com/gh_mirrors/m4/m4s-converter 判断你是否…

告别白模时代:Blender3mfFormat 让 3MF 导入导出一次跑通设计到打印

告别白模时代:Blender3mfFormat 让 3MF 导入导出一次跑通设计到打印

2026/8/20 0:08:45

告别白模时代:Blender3mfFormat 让 3MF 导入导出一次跑通设计到打印 【免费下载链接】Blender3mfFormat Blender add-on to import/export 3MF files 项目地址: https://gitcode.com/gh_mirrors/bl/Blender3mfFormat 按 3MF 官方规范的字面意思,一…

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

2026/8/17 12:00:53

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…

导师推荐!2026最新AI论文工具测评与实用推荐

导师推荐!2026最新AI论文工具测评与实用推荐

2026/8/15 10:10:27

2026年真正好用的AI论文工具,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

告别游戏崩溃:XCOM 2模组管理器的智能革命

告别游戏崩溃:XCOM 2模组管理器的智能革命

2026/8/18 12:20:24

告别游戏崩溃:XCOM 2模组管理器的智能革命 【免费下载链接】xcom2-launcher The Alternative Mod Launcher (AML) is a replacement for the default game launchers from XCOM 2 and XCOM Chimera Squad. 项目地址: https://gitcode.com/gh_mirrors/xc/xcom2-lau…