什么是 模型推理?
模型推理(Model Inference)是使用已训练模型处理新输入,产生预测、分数、Embedding、分类或生成结果,并且在该请求中不主动更新模型参数的执行过程。
快速了解
| 创建时间 | 机器学习基础概念,起源于 1950 年代 |
|---|
工作原理
推理契约包含模型与预处理 Revision、输入 Schema、后处理、硬件与 Runtime Config,以及输出语义。负载可以是 Online、Streaming、Batch、Edge 或 Embedded。分类模型可能一次 Forward Pass 返回预测,自回归语言模型则会先 Prefill,再重复 Decode,最后返回或流式发送文本。性能必须按真实部署负载评测:Latency、Throughput、Memory、Error 与 Cost 都不能替代 Prediction Quality、Calibration、Structured-output Validity 或 Task Success。固定 Seed 也不能保证跨 Framework Version、Kernel、Device 或分布式调度完全复现。
主要特点
- 把特定已训练模型 Revision 应用于输入,不在单次请求中主动更新权重
- 把预处理与后处理纳入行为契约,而不是只记录模型文件
- 可采用同步、异步、Batch 或 Streaming 执行形态
- 在明确边界定义 Latency、Throughput、Memory、Error 与 Quality 指标
- Precision、Runtime、Tokenizer、Template、Hardware 或 Decoding 变化都可能改变行为
- 安全发布需要版本化输入、输出、Finish State 与可复现证据
常见用途
- 在线分类、排序、预测与异常检测 API
- 自回归文本、代码、图像、音频或多模态生成
- 离线 Pipeline 中的 Batch Scoring 与 Embedding 生成
- 移动端、边缘与嵌入式设备上的低延迟预测
- 生产模型评测、Shadow Traffic、Canary 发布与 Drift Monitoring
示例
Loading code...常见问题
模型训练与推理有什么区别?
训练根据数据与目标函数估计或更新模型参数;推理则把选定参数 Revision 应用于新输入,不在该请求中主动更新参数。训练、Fine-tuning、Evaluation 与 Inference 都可能在模型生命周期中重复发生,不能简单理解为训练只做一次、推理只在训练后发生。
生产推理 Pipeline 包含哪些步骤?
生产链路通常会校验并转换输入,选择已授权模型与可选 Adapter,调度执行,运行模型,后处理输出,并记录 Finish State、Usage、Error 与 Version Identity。生成式系统还可能执行 Tokenization、建立 Cache、重复 Decode、应用停止条件和发送 Partial Output。
如何评测模型推理性能?
指标应匹配负载并使用明确边界。在线服务需要 Latency Percentile、Throughput、Queue Time、Error Rate、Memory 与 Cost;流式生成还要看 TTFT 与 ITL;Batch Job 关注 Completion Time 与 Utilization。所有比较都必须保留质量、Calibration、Structured Output 或 Task Success 门禁。
量化一定会让推理更快吗?
不一定。低精度可能减少 Weight Memory 与 Memory Traffic,但速度取决于模型 Shape、Hardware Support、Kernel、Batch/Sequence Distribution、Transfer Overhead 与 Compilation,也可能改变输出。必须在目标 Runtime 上评测精确格式,并执行 Task Quality 回归。
Temperature 为 0 时模型推理一定可复现吗?
不一定。Greedy Token Selection 消除了 Sampling Randomness,但 Model Revision、Tokenizer、Template、Precision、Kernel、Floating-point Reduction Order、Hardware、Parallel Execution 与 Runtime Version 仍可能改变结果。可复现需要固定执行契约与测试,Seed 或 Temperature 单独不足以保证。