大语言模型(LLM,Large Language Model)是一种基于 Transformer 架构的深度学习模型,核心任务是根据前文预测下一个 Token,从而生成连贯的自然语言。它不是一个单一程序,而是一套在海量文本上训练出来的概率模型。
它是怎么工作的
- 训练阶段:从互联网、书籍、论文等来源收集大规模文本,让模型反复学习词语之间的统计关联
- 推理阶段:给定输入(Prompt),模型按概率逐词生成输出,每生成一个 Token 就继续预测下一个
- 规模效应:参数量越大、训练数据越多,模型在语言理解、推理、代码等任务上的表现通常越好
能力与边界
LLM 擅长翻译、总结、问答、写作、代码生成等「语言任务」,但它并不真正理解世界,输出基于统计概率而非事实判断,因此可能产生错误信息(俗称「幻觉」)。
主流代表包括 OpenAI 的 GPT 系列、Anthropic 的 Claude 系列、Google 的 Gemini,以及开源的 Llama、Qwen(通义千问)、DeepSeek 等。
一句话:LLM 是「会接话」的概率模型,把提示词写清楚、把输出校验好,是使用它的两条基本准则。