大型语言模型(large language model, LLM)是以大规模文本或多模态数据训练、通常拥有数十亿乃至更多参数的神经网络模型。其核心任务是:在给定上下文的条件下估计下一个词元(token)的概率,并反复生成序列。它们不是必然可靠的数据库或推理者,而是把分布式表示、训练数据中的知识与后训练形成的行为策略结合起来的概率模型。2017年Transformer问世后,预训练规模、数据、计算和后训练共同推动了通用生成式AI。
核心判断:LLM最适合作为可验证工作流中的生成与转换组件;在高风险任务中,必须辅以检索、工具、约束、评测和人类监督。
自然语言处理(NLP)研究计算机如何表示、理解和生成语言,任务包括分词、翻译、问答、信息抽取、摘要和对话。语言模型把句子概率分解为:
P(w_1,\ldots,w_T)=\prod_{t=1}^{T}P(w_t\mid w_{<t}).
早期 n-gram 模型用最近若干词近似历史,简单但有数据稀疏和固定短上下文问题。Bengio等人的神经概率语言模型(2003)用可学习词向量表示词,再用神经网络预测下一个词,标志着从计数模型转向分布式表示。
RNN用隐藏状态递归累积历史,LSTM用门控记忆缓解梯度消失和长距离依赖;但逐步处理序列限制了并行训练。神经网络通过反向传播计算损失对参数的梯度,再用梯度下降更新参数。参数是模型学到的数值;参数量是容量的粗略指标,不等于知识量、智能或可靠性。
Vaswani等人在《Attention Is All You Need》(2017)提出Transformer,完全以注意力取代循环结构。缩放点积注意力为:
Attention(Q,K,V)=softmax(QK^T/\sqrt{d_k})V.
Query、Key、Value分别表示查询、匹配依据和被聚合的信息。自注意力允许一个位置直接关注其他位置;多头注意力在多个表示子空间并行学习不同关系。因果模型使用未来屏蔽,保证生成第t个token时不能读取真实未来token。位置编码、残差连接、层归一化和前馈网络共同提高深层训练稳定性。
文字/图像/音频 → token化与嵌入 → Transformer层 ↓ 概率分布 P(next token) ↓ 解码/采样 → 新token → 循环生成
BERT采用双向编码器和掩码语言模型,擅长理解类任务;GPT系列采用因果解码器,天然适合开放式生成;T5等编码器—解码器模型适合翻译、摘要等序列到序列任务。
Token化把文本切成词、子词、字符或字节片段。BPE、WordPiece和SentencePiece在词表大小、未知词处理和跨语言效率之间折中。模型读取的是token ID及其向量,不是人类意义上的“词”;不同语言、代码和数学符号的token效率不同,影响上下文长度与成本。
预训练在大规模、通常未标注的数据上进行自监督学习:因果模型预测下一个token,掩码模型预测被遮盖片段。研究显示损失通常随计算量、参数量和数据量近似幂律下降;Chinchilla研究进一步强调,固定计算预算下,参数量和训练token应大致同步扩展,不能只追求模型变大。
预训练后通常进行:
“对齐”不是单一属性:有帮助、诚实、无害、隐私保护和服从用户可能冲突;RLHF也可能造成迎合、过度拒答或奖励黑客。
目标与风险界定 → 数据取得/许可/清洗/去重/过滤 → tokenizer与架构设计 → 预训练(分布式优化) → 验证、去污染与能力评测 → SFT/指令调优/偏好优化 → 安全红队、部署与监控 → 反馈、修复、再评测、版本迭代
文本生成、改写与摘要:适合邮件、说明、创意草稿、摘要和风格转换,但可能遗漏限定条件或捏造事实。
翻译:跨语言转换能力强,低资源语言、术语一致性和文化语用仍不均衡。
编码:可补全代码、解释错误、生成测试和脚本;真实软件工程还需要环境配置、需求澄清、测试覆盖、依赖安全与维护。
推理:能进行分步解题、分类和规划,但解释不一定忠实反映内部过程;错误推理可能得到偶然正确答案。所谓“涌现能力”仍有争议,部分突变来自离散指标和提示格式。测试时计算和代码执行器可提高部分数学/规划表现,却增加延迟和成本。
多模态:视觉—语言、语音—语言和文档模型可描述图像、读取表格和进行语音交互;其限制包括视觉幻觉、OCR错误、空间关系不稳和跨模态偏见。
开放权重模型允许下载参数并本地运行,利于隐私、复现、量化、领域适配和边缘部署;但“开放权重”不等于训练数据、代码、许可和完整训练过程开放。专有模型通常提供更成熟的托管、多模态集成和安全运营,但存在黑箱、版本漂移、API限制、数据驻留和供应商锁定。选择应依据任务、敏感性、延迟、总拥有成本、合规、可审计性和工程能力,而非单一排行榜。
评测应同时包含能力、可靠性和社会影响。HELM在任务—领域—语言场景中联合测量准确率、校准、鲁棒性、公平性、偏见、毒性和效率,提醒我们不要只看一个总分。
应结合MMLU、GPQA、BIG-bench、GSM8K、HumanEval/SWE-bench、MMMU等离线基准与真实用户任务;测量事实一致性、引用可核验性、拒答质量、不确定性、延迟、成本、能耗、API漂移和维护性。还要进行红队、越狱、提示注入、隐私泄漏、偏见和危险能力测试,并检查训练/测试污染。
安全策略包括数据过滤、SFT/RLHF或偏好优化、模型/系统卡、内容分类器、最小权限、沙箱、输出校验、检索引用、人工复核、事件响应和持续监测。NIST的生成式AI风险管理思路强调Govern–Map–Measure–Manage全生命周期治理、红队测试和明确的继续/停止决策;对齐测试能降低风险,但不是安全证明。
LLM降低了文本、代码和知识工作的进入门槛,可能提升生产率并催生模型运维、数据治理和AI审计岗位;但收益可能集中于拥有数据中心、芯片和资本的组织,自动化会重组就业并扩大数字鸿沟。AI Index 2025同时记录了推理成本下降、小模型进步和开放权重扩散,以及训练计算、能源和产业集中度上升。
减缓措施包括蒸馏、量化、稀疏化、混合专家、缓存、批处理、按需调用小模型、绿色电力、碳/水披露,以及优先使用检索和规则系统解决不需要生成的问题。
较可能的方向是更小而专门化的模型、多模态和长上下文、可靠工具调用与代理工作流、可验证计算、隐私保护学习、更好的数据治理、模型行为监控和标准化审计。仍不确定的是:规模是否继续带来普遍智能,代理能否稳定完成长时任务,链式思维是否真实反映推理,以及模型是否会替代整类职业。未来研究应优先采用因果、透明、可复现证据,而非单凭演示或排行榜。
进一步问题包括:如何在不泄露隐私和版权内容的情况下构建高质量数据?如何评估跨语言、跨文化和长时代理的可靠性?哪些推理评测真正测量泛化而非记忆?如何把证据链和不确定性呈现给非技术用户?在医疗、教育和公共服务中何时应拒绝自动化?如何公平分配生产率收益并降低能源和就业转型成本?
可下载并列比较表:
文中代表性依据包括Bengio等(2003)、Hochreiter与Schmidhuber(1997)、Vaswani等(2017)、Devlin等(2019)、Brown等(2020)、Lewis等(2020)、Kaplan等(2020)、Ouyang等(2022)、Hoffmann等(2022)、Liang等(2022)、NIST(2024)及Stanford HAI(2025);链接已嵌入正文。文中将截至2025年的权威公开指标与截至2026年可见研究趋势区分开来;对仍有争议的主张已明确标注为未决问题。