大模型基础
把关键词说清楚,后面看工具和玩法就不懵。
Tokenizer(分词器)
模型不直接读「字」,而是把文本切成 token(可能是词片、子词)。计费、上下文长度常常按 token 算。同一句话,不同模型切出来的 token 数可能不同。
Context(上下文窗口)
一次对话里模型「看得见」的长度上限。窗口大不等于事事记得住:中间内容更容易被忽略,重要约束宜放在开头/结尾并反复强调。
训练 vs 推理
训练是用海量数据更新模型权重(极贵、要集群);你日常聊天、调用 API 几乎都是推理——固定权重,前向算出下一个 token。微调/后训练介于两者之间:用较少数据改一点权重,适配你的任务或风格。
微调(Fine-tuning)
在基座模型上继续训练,让它更懂你的术语、格式或领域。常见有全参微调与参数高效方法(如 LoRA/QLoRA)。没有干净数据与评测集时,优先先把提示词和 RAG 做好。
Embedding(向量表示)
把文本映射成向量,用相似度做检索、聚类、去重。RAG 的「找相关段落」通常靠 embedding + 向量库,而不是让大模型硬背全文。
RAG(检索增强生成)
先从你的文档/数据库里检索相关片段,再塞进提示词让模型回答。适合「公司知识库、论文库、产品文档」——比纯靠模型背更可控,但仍要防检索错与胡编引用。
Agent(智能体)概念
不止一问一答:模型可以规划步骤、调用工具(搜索、代码、浏览器、API),再根据结果继续。复杂任务要加校验、权限边界与人工确认,否则容易「自信地做错」。