Skip to content

大语言模型(LLM)原理

什么是大语言模型

大语言模型(Large Language Model,LLM)是一类基于海量文本数据训练、拥有数十亿甚至数万亿参数的语言模型。它们能够理解、生成和处理自然语言,并展现出强大的通用能力,如问答、翻译、代码生成、逻辑推理等。

Transformer 架构

大语言模型的核心架构是 Transformer,其关键创新是自注意力机制(Self-Attention)

自注意力机制让模型在处理每个词时,能够动态地关注输入序列中其他相关的词,从而捕捉长距离的依赖关系。计算公式可以概括为:

Attention(Q, K, V) = softmax(QK^T / √d_k) V

其中 Q(Query)、K(Key)、V(Value)分别由输入通过不同的线性变换得到。与 RNN 的顺序处理不同,Transformer 可以并行计算,极大地提升了训练效率。

预训练与微调

大语言模型的训练通常分为两个阶段:

预训练(Pre-training)

在海量无标注文本上进行自监督学习,让模型掌握语言的通用规律和知识。常见的目标是下一词预测(Next Token Prediction),即给定前面的文本,预测下一个词。

微调(Fine-tuning)

在预训练模型的基础上,使用特定任务的标注数据进行进一步训练,使模型适应特定领域或任务。此外,**指令微调(Instruction Tuning)基于人类反馈的强化学习(RLHF)**进一步提升了模型遵循指令和与人类价值观对齐的能力。

大语言模型的关键能力

  • 语言理解:理解语义、情感、意图等。
  • 文本生成:生成连贯、流畅的自然语言文本。
  • 上下文学习:通过少量示例(Few-shot)快速适应新任务。
  • 多轮对话:在对话中保持上下文一致性。
  • 工具调用:调用外部 API、执行代码等扩展能力。

常见的大语言模型

目前主流的大语言模型包括 OpenAI 的 GPT 系列、Anthropic 的 Claude、Google 的 Gemini、Meta 的 Llama 系列,以及国内的 DeepSeek、通义千问、文心一言等。其中开源模型(如 Llama、DeepSeek、Qwen)推动了整个生态的快速发展。

大语言模型的局限

尽管能力强大,大语言模型仍存在一些局限:

  • 幻觉(Hallucination):可能生成看似合理但事实错误的内容。
  • 知识时效性:训练数据存在截止时间,无法获知最新信息。
  • 推理成本:参数量大,部署和推理需要较高的计算资源。
  • 可解释性差:难以解释模型做出特定决策的原因。

分享人工智能、机器学习与大模型的学习笔记