LLM 开发总览:从模型能力到可运行应用

# LLM 开发总览:从模型能力到可运行应用

本篇目标

建立 LLM、模型 API、AI 应用和 Agent 的整体关系。学完后,你应该知道一次模型请求经历什么,以及后续每篇笔记分别解决哪一类问题。

理解 LLM分清模型与应用看懂生成链路建立学习地图

# 先记住一句话

LLM 负责根据上下文预测并生成内容,应用代码负责准备上下文、调用模型、校验结果,并处理权限、状态、费用和失败。

LLM 全称是 Large Language Model,即大语言模型。它通过大量文本和代码学习语言规律,接收一段上下文后,逐步预测接下来最可能出现的 Token。

# 模型、应用和 Agent 是什么关系

层级 负责什么 不负责什么
LLM 理解输入、推理并生成文本或结构化内容 数据库事务、真实权限和外部操作结果
模型 API 把输入、参数和模型输出封装成可调用接口 自动保证业务正确性
AI 应用 组织 Prompt、数据、校验、缓存、错误和用户界面 不应把关键业务规则交给模型猜
Agent 在应用控制下选择工具、维护任务状态并循环决策 不是一种新的模型

普通 AI 应用可以只调用一次模型;Agent 则可能让模型在多轮决策中调用工具。两者都会使用 LLM,但系统复杂度不同。

用户输入
  ↓
应用校验权限并组装上下文
  ↓
模型 API 将请求交给 LLM
  ↓
LLM 按 Token 逐步生成结果
  ↓
应用校验格式、保存结果并返回用户
1
2
3
4
5
6
7
8
9

# 训练和推理不要混淆

  • 训练(Training):用大量数据调整模型参数,让模型学会语言规律和任务能力;
  • 推理(Inference):使用已经训练好的模型,根据当前输入生成结果;
  • 微调(Fine-tuning):在基础模型上使用特定数据继续训练,使行为更贴近目标任务。

日常调用模型 API 做摘要、问答或代码生成属于推理,不是在训练模型。把用户对话放进 Prompt,也不会自动修改模型参数。

# 一次文本生成请求包含什么

部分 作用 例子
模型 决定基础能力、速度和价格 选择适合文本任务的模型
Instructions 说明稳定规则和输出要求 “只根据提供的资料回答”
Input 本次需要处理的数据 用户问题和文章正文
推理参数 控制输出长度、随机性或推理投入 最大输出 Token、Temperature
Output 模型返回的文本、结构化数据或其他项目 摘要、分类结果、拒绝信息
Usage 本次请求使用的 Token 等计量数据 输入 Token、输出 Token

不同模型提供方的字段名称可能不同,但职责大致相同。工程上先理解这些概念,再映射到具体 SDK。

# LLM 擅长什么,又不保证什么

LLM 擅长语言转换、摘要、分类、信息抽取、代码辅助和基于上下文回答。它的输出来自概率生成,因此表达流畅不等于事实正确。

模型通常不会自动知道:

  • 训练截止时间之后发生的事实;
  • 公司数据库中的实时数据;
  • 当前用户真正拥有的权限;
  • 外部接口刚才是否执行成功;
  • 某段内容是否满足你的业务规则。

实时知识可以通过检索或工具提供,权限和数据校验必须由应用代码执行,关键结果还要使用测试和评测验证。

# LLM 学习地图

1
输入与生成基础

先理解 Token、上下文、注意力和 Transformer 怎样共同完成文本生成。

2
模型调用

掌握模型 API、消息角色、流式输出、结构化输出和常见生成参数。

3
语义与模型选择

理解 Embedding 的用途,并根据质量、延迟和成本选择模型。

4
工程边界

处理限流、重试、缓存、并发和方案选择,让调用链真正可运行。

5
项目实战

沿一条真实调用链检查输入、模型、输出、费用、错误和评测。

# 项目中应该怎样分层

接口层:认证、参数校验、请求取消
  ↓
业务层:决定任务目标、资料范围和失败语义
  ↓
模型客户端:组装模型参数、超时、重试和响应解析
  ↓
模型提供方:执行推理并返回结果与用量
1
2
3
4
5
6
7

模型客户端应该隐藏具体 SDK 的细节,但不能吞掉请求 ID、用量、限流和拒绝等重要信息。业务层依赖自己的小接口,方便替换模型和编写 Fake 测试。

# 项目面试怎样表达

我把模型能力当作一个不稳定且按量计费的外部依赖。应用先校验用户和输入,再按 Token 预算组装上下文,通过独立模型客户端设置超时并调用模型。返回后先校验结构和业务规则,再持久化结果;同时记录模型版本、延迟、Token 和错误类型,用固定评测集验证升级是否回退。

# 高频面试题与回答

1. LLM 本质上在做什么?参考答案

LLM 接收一段由 Token 组成的上下文,计算下一个 Token 的概率分布,再选出一个 Token 追加到结果中并重复执行。它学到的是语言和知识模式,不是一个会自动访问真实数据库的业务系统。

2. LLM 和 Agent 有什么区别?参考答案

LLM 是生成和推理能力,Agent 是围绕模型建立的运行系统。Agent 会把目标、工具、状态和停止条件组织成循环,但权限校验、工具执行和状态持久化仍由应用负责。

3. 调用模型 API 算不算训练模型?参考答案

不算。模型 API 通常执行的是推理,即使用现有参数根据输入生成结果;训练或微调才会更新模型参数。把历史消息放进上下文只会影响本次请求,不会自动写进模型权重。

4. 为什么模型回答流畅仍可能是错的?参考答案

因为模型的直接目标是生成符合上下文规律的内容,不是查询一个始终正确的事实数据库。输入缺少证据、问题超出知识范围或生成过程选错方向时,都可能产生看似合理的错误,所以关键事实要提供证据并进行校验。

# 接下来学什么

下一篇学习 Token、上下文窗口与注意力,理解模型真正接收的输入单位以及为什么上下文并不是越长越好。

# 参考资料