大模型评估治理与安全

围绕大模型评估、治理和安全构建系统化工程能力。覆盖 Harness Engineering、LLM-as-Judge、红蓝对抗、提示词注入防御、Guardrails、Jailbreak 分析、OWASP Agentic Top 10、审计追踪和生产质量门禁,帮助团队降低 AI 应用上线后的安全与可靠性风险。

本专栏共 13 篇文章 · 创建于 2026-04-01
1

AI Agent Harness Engineering:运行时控制、范围与边界

消除 Harness Engineering 与机械/线束工程歧义,定义 AI Agent 运行时控制学科:覆盖身份、工具权限、状态、预算、审批、可观测事件、评测与恢复,并明确 Prompt、MCP、Sandbox、DevOps、架构、实现和测试各自负责什么,帮助生产 Agent 团队避免把框架、沙盒或模型自评误当成授权与安全保证。

2

Agent Harness 实战:状态、权限、工具与恢复

系统讲解 Agent Harness 实战:从类型化运行状态、权限策略和 MCP 工具适配,到持久化审批、幂等副作用、未知结果恢复、脱敏观测与故障测试,帮助团队把模型输出限制为待审提案,构建可恢复、可审计且不会因盲目重试重复执行外部写入的生产级智能体运行时,并建立贯穿开发测试、灰度发布和事故调查的统一证据链,避免把框架能力误当成安全保证。

3

LLM 越狱防御:威胁建模、分层控制与安全评测

从真实结果而非拒答措辞出发设计 LLM 越狱防御:建立资产与权限威胁模型,限制 Tool 和数据能力,评测自适应多轮攻击,用人工标注校准自动 Judge,同时衡量误拒答、越权副作用、成本与延迟,并把每次事故沉淀为可复现回归测试和发布门禁,适用于 RAG、浏览器 Agent、客服与高权限自动化工作流。

4

Agent 评测 Harness:回放、故障注入与发布门禁

构建可复现的 Agent 评测 Harness:重置环境状态、执行重复 Trial、回放 Tool、注入可控故障、分别评估 Outcome 与 Trajectory、校准 LLM 裁判,并在模型之外执行步数、时间、Token、成本和安全门禁。本文还覆盖环境快照、可控 Intervention、确定性 Oracle、发布回归与人工复核,不依赖隐藏思维链或一次偶然成功。

5

LLM-as-a-Judge:校准、偏差与发布门禁

构建超越 ROUGE 和 BLEU 的可校准 LLM-as-a-Judge 流水线,系统掌握 Judge Contract、Pairwise 换序测试、人类控制集、切片指标、偏差审计与发布门禁,并区分评估证据、事实真值与高影响动作授权边界,避免把固定一致率误作通用准确度,适合生产级 LLM、RAG 和 Agent 评测团队。

6

LLM Guardrails:控制边界、评测与 Go 实现

系统讲解 LLM Guardrails 如何保护提示词、检索上下文、模型输出、工具调用与外部副作用。内容覆盖威胁建模、信号与执行分离、最小权限、流式缓冲、Fail Open/Fail Closed、Go 门禁实现、误放行与误拦截评测,以及灰度发布和回滚方法,帮助团队构建可验证、可审计的 AI 护栏体系。

7

当 AI Benchmark 误导我们:一套可复现的模型评估方法

当公开分数只是有限证据时,如何严谨评估大语言模型,适合企业模型选型、Agent 发布和长期回归治理。本文解释数据污染、天花板效应、标注分歧、Goodhart 效应、Judge 偏差和工作负载错配,进一步给出版本化任务集、数据来源记录、确定性 Oracle、校准的人类或模型复核、成本延迟测量与发布门禁的方法。

8

AI 爬虫治理:区分搜索、训练与 Agent 访问

从网站经营者视角建立可执行的 AI 爬虫治理方案:区分搜索索引、模型训练、实时 AI 引用和用户触发 Agent,准确理解 RFC 9309、robots.txt、爬虫身份核验、WAF、限流、Content Signals、AI Labyrinth、内容授权与审计边界,在保护内容和服务器容量的同时避免误伤正常搜索发现。

9

AI Agent 记忆与删除权:可落地的隐私架构

围绕目的限定、数据最小化、来源追踪、保留期限、访问控制、删除传播和可验证证据设计 AI Agent 记忆。解释向量、摘要、缓存、备份、微调与模型输出为什么需要独立治理,帮助构建符合 GDPR 风险管理思路的长期记忆系统,适用于个人助手、企业 RAG、客服 Agent 和包含敏感数据的自动化工作流与知识库。

10

欧盟 AI 法案合规实操:工程证据清单

把修订后的 EU AI Act 转化为可审计工程流程,同时避免让代码替代法律判断。本文覆盖 2026 Digital Omnibus 时间线、经营者角色、预期用途与高风险路径、Article 50 透明度、版本化技术文档、日志、人类监督、FRIA 边界、合格评定和上市后监控,并提供只检查证据完整性的可运行 Go 发布门禁。

11

DeepSeek Harness 架构:Cordis、Profile 与运行模式

系统解析 DeepSeek Harness 这一 Preview 阶段 Agent 运行时:Cordis 插件、Launch Profile、产品运行模式、Append-only Session Evidence、Capability Seam、桌面与 Web 入口、安全边界,以及可执行的 Go 接入门禁。帮助团队区分界面模式、进程组合与部署载体,并建立版本锁定、兼容测试和恢复责任。

12

DeepSeek Harness 插件开发:Cordis 服务、事件与生命周期

从 apply 函数、inject 依赖声明和可逆副作用入手,讲解 DeepSeek Harness 的 Cordis 插件开发。本文覆盖服务接口、事件派发、工具策略 Hook、权限拒绝与审批、配置 Overlay、资源清理、会话事件、版本锁定和升级测试,帮助开发者以最小扩展接缝构建可卸载、可审查、可回滚的 Agent 能力,而不把模型提案或 Schema 校验误作授权。

13

DeepSeek Harness 会话:轨迹、回放与恢复边界

理解 DeepSeek Harness 的追加式 Session Log、Trajectory 检查、Fork、Resume 与 Replay 语义,以及模型可见上下文重建和会话事件扩展。本文区分会话轨迹、聊天记录与外部副作用账本,覆盖工具调用结果、取消、兼容升级、敏感数据保留、操作 ID 和未知结果对账,说明为什么可回放日志不能安全地重复部署、支付、工单或文件写入。