这三个词经常同时出现,但指向完全不同的东西。
- Token:模型处理文本的最小单位。中文一个汉字通常对应 1~2 个 Token,英文一个单词约 1~2 个 Token。计费、长度限制都以 Token 为单位
- 上下文窗口(Context Window):模型一次能「看到」的输入+输出总长度。例如 128K 上下文大约相当于 8~10 万字中文。超过上限的部分会被截断
- 参数量(Parameters):模型内部可学习的权重数量,如 7B = 70 亿参数。参数量大通常代表能力更强,但也意味着推理更慢、部署成本更高
它们的关系
- 参数量决定「模型有多强」,上下文窗口决定「一次能读多长」,Token 是两者通用的计量单位
- 长上下文不等于长记忆:模型并不会把之前的对话永久记住,每次调用都是「重新读一遍」
- 上下文窗口越长,价格通常越高;日常使用应把关键信息放在提示词前部,避免被截断
选型建议:文档分析类任务优先看上下文窗口,简单问答和写作优先考虑性价比,本地部署则要先算清楚显存能否装下对应参数量的模型。