AI 架构师课程:从基础到生产部署

面向 AI 架构师的系统化学习路径,覆盖机器学习基础、Transformer、LLM 推理、RAG、向量检索、多 Agent 架构、模型部署、成本优化、安全治理、生产级可观测性、架构决策方法、团队技术路线规划和真实业务落地案例。适合希望从应用开发升级到 AI 系统设计、技术选型和工程落地负责人的开发者。

本专栏共 18 篇文章 · 创建于 2026-02-21
1

Transformer 架构详解:核心模块、变体与推理成本

系统理解 Transformer 架构:从残差流、注意力掩码、前馈网络和位置编码,到仅编码器、仅解码器与编解码器模型的信息流差异。文章进一步拆解训练、Prefill、逐 Token Decode、KV Cache 容量和计算复杂度,并提供可运行 Go 配置审计程序与生产验证清单,帮助开发者避免因果泄漏、位置错位和缓存不一致。

2

注意力机制详解:QKV、掩码、多头注意力与工程实践

注意力机制如何计算?本文从 QKV 张量形状、缩放点积和因果掩码讲到多头注意力、MQA/GQA、FlashAttention、KV Cache、复杂度、数值稳定性与测试方法,并用可运行 Go 代码解释常见实现错误,帮助开发者真正理解 Transformer 的信息路由、训练推理差异与生产级工程边界。

3

深度学习基础:优化、架构与评测方法

严谨介绍神经网络、自动微分、优化算法、CNN、序列模型、Transformer、生成模型、数据泄漏、正则化和可复现评测。区分示意公式与生产决策,补充数据切分、标签质量、失败分析、分布偏移、推理成本、隐私边界、模型血缘、线上观测、灰度验证、成本核算、部署治理和回滚要求,不使用未经验证的性能断言或硬性工具推荐。

4

神经网络详解:前向传播、梯度、损失函数、泛化与工程实践

系统理解神经网络:从仿射层、激活函数、Logit、损失函数和反向传播,到初始化、优化器、梯度健康、数据泄漏与泛化评测。本文提供可运行 Go 前向计算示例,解释回归、二分类、多分类和多标签任务的输出契约,并给出 Shape、数值稳定、Tiny-Batch 过拟合、校准、分布外切片与部署前处理一致性的验证方法。

5

向量嵌入工程指南:模型选型、语义检索评测与安全迁移

向量嵌入如何支撑语义搜索和 RAG?本文从向量空间、任务类型、归一化与距离函数讲到模型选型、混合检索、重排、Recall@k 评测、索引容量、权限过滤和双索引迁移,帮助开发者用真实查询集验证 Embedding,而不是依赖排行榜、固定维度或无条件相似度阈值。还覆盖向量版本契约、数据删除、跨租户隔离、近似索引取舍和生产监控。

6

生成式 AI 核心解析:模型原理、评测体系与生产治理

系统理解生成式 AI 如何生成文本、图像、音频、视频与代码,比较自回归模型、扩散模型、GAN、VAE 的机制与适用边界;进一步学习如何按真实工作负载选型,建立任务质量、严重失败、分片表现、延迟和成本评测,并用 NIST 风险框架、C2PA 内容溯源、上线门禁、持续监控和故障回滚构建可审计、可演进的生产系统。

7

NLP 自然语言处理入门:任务、分词、模型选择与评测

自然语言处理如何从文本走到可验证的业务结果?本文梳理文本分类、情感分析、实体识别、翻译与问答,解释中文分词、子词及字符偏移量的区别,对比规则、传统分类器、BERT 与生成模型,并用可运行的 Go 示例计算混淆矩阵和宏平均 F1,说明标签定义、数据隔离、无效输出、拒答和线上漂移为何决定系统是否可靠,帮助开发者建立可复核的模型选择依据。

8

扩散模型:前向加噪、采样与评测边界

从前向加噪到学习去噪,系统理解扩散模型、DDPM/DDIM 采样、潜在扩散、条件控制和部署权衡。区分数学公式与版本敏感的 Diffusers 代码,补充可复现记录、随机种子、调度器、模型检查点、安全、许可证、质量、延迟、显存、成本、失败分析、人工复核、数据治理和回滚评测,避免固定性能与硬性工具推荐。

9

LLM 推理全链路:Prefill、Decode、指标与生产调优

LLM 推理如何从消息生成文本?本文拆解 Chat Template、Tokenization、Queue、Prefill、Decode、KV Cache、Streaming 与停止条件,区分 TTFT、TPOT、ITL、吞吐量和 Goodput,给出显存容量、连续批处理、基准测试、质量回归、租户隔离与回滚门禁,帮助团队按真实负载定位延迟、OOM 和输出漂移。

10

混合专家模型 MoE 架构:路由、训练与推理部署

系统理解混合专家模型 MoE 的 Token 路由、稀疏激活与专家并行,厘清总参数、激活参数、FLOPs、显存、吞吐、延迟和模型质量之间不能直接换算的边界。本文从批量路由数据路径出发,讲清训练阶段的负载均衡、容量与溢出策略,以及推理阶段的专家权重常驻、All-to-All 通信、Grouped GEMM、Prefill 与 Decode 差异,并给出可复现的稠密模型与 MoE 模型评测契约,帮助训练、推理和平台团队避免把架构参数误当成生产性能。

11

推理模型解析:o1、DeepSeek R1 与工程评测

推理模型不是一种统一架构。本文以 OpenAI o1 与 DeepSeek R1 为证据,拆解底座架构、后训练与推理期策略的边界,准确区分 R1-Zero 和完整 R1 训练流程,并给出测试时算力、验证器、预算匹配评测、失败模式、Go 验证代码和生产发布门禁,帮助开发者在质量、延迟、成本与安全之间做可复现的工程选型。

12

Mamba 与状态空间模型:机制、演进与工程选型

深入理解 Mamba 与状态空间模型:从递推、离散化和选择性扫描,到 Mamba-2 SSD、Mamba-3、固定状态、精确回忆、混合架构与完整模型基准契约;明确线性复杂度不等于固定吞吐,帮助团队按质量、延迟、显存、内核和真实负载完成架构选型,并建立可复现的质量回归、长度泛化、数值稳定性与回滚门禁。

13

大模型推理强度工程:思考预算、路由与生产评测

系统讲解如何在生产环境管理大模型推理强度:区分各厂商的 Effort、Adaptive Thinking、Thinking Level 与 Token Budget 契约,分析隐藏 Token 计费、答案截断、路由误判、工具重试和思维文本不忠实问题,并用同预算评测与 Go 门禁选择单个可验证任务成本最低的模式。

14

Claude 4 Opus 与 Sonnet:基准、选型与迁移实战

Claude 4 曾以混合推理、工具调用和编码能力推动 Agent 工程升级,但发布分数、7 小时案例与 ASL-3 经常被过度解读。本文还原 Opus 4 与 Sonnet 4 的基准条件、成本和安全边界,给出可运行的 Go 评测门禁、生产控制清单,以及原始 API 型号退役后的迁移方法,帮助团队用自有任务而非营销榜单完成模型选型。

15

上下文工程四层架构:指令、知识、记忆与编排

用版本敏感的四层模型设计 AI 上下文:指令层、知识层、记忆层和编排层。本文覆盖 Token 预算、检索路由、来源新鲜度、记忆压缩、租户隔离、工具结果校验、权限边界、Prompt Injection、失败路径、成本延迟遥测和可复现评测,适用于 RAG、客服 Agent、企业知识库和多轮会话,不把固定比例或模型行为当作通用事实。

16

Mixture of Agents:架构、评测与 Go 实现

面向生产环境的 Mixture of Agents 深度指南:讲清原始 MoA 与 Self-MoA、候选多样性、聚合器失真与相关错误,给出版本化评测、成本和延迟门禁,以及保留候选证据链、支持受控降级的可编译 Go 编排实现,帮助团队判断何时使用单模型、自集成或异构多模型,并用 Ablation 和任务结果而非调用数量证明真实收益。

17

推理时计算实战:Test-Time Compute 预算与验证

推理时计算(Test-Time Compute)如何转化为可靠答案?本文解释长链推理、自一致性投票、Best-of-N、思维树和验证器的适用边界,区分推理 Token、输出上限与真实费用,提供可运行的 Go 预算控制器,并介绍候选选择、提前停止、预算耗尽、搜索约束及分层评测方法,帮助开发者用准确率、覆盖率、成本和延迟共同判断额外计算是否值得。

18

LLM Gateway 架构:控制面、数据面与生产边界

系统讲解 LLM Gateway 的控制面与数据面:统一工作负载身份、模型别名与协议能力契约,实施请求、Token、并发和预算配额,处理流式取消、首字节后的重试边界、重试预算、熔断与成本预留结算,并通过租户缓存隔离、密钥保护、隐私化遥测、配置影子验证、灰度和自动回滚,避免跨模型降级、审计与计量链路在生产环境放大质量、安全和可用性风险。