深度调研(Probe):用智能体解决系统问题
范围与阅读提示
本 probe 把“类似 SysSpec”限定为:大语言模型智能体会产生或修改可执行的系统制品,或者会对运行中的系统执行诊断、配置与控制动作;编译器、测试、形式检查或真实基准的反馈必须能改变下一轮行动。纯聊天建议、只预测性能的模型、只优化智能体运行时的系统,以及没有执行反馈的普通代码补全不进入核心版图。
这一边界把研究对象与 Agent-Systems 区分开:Agent-Systems 研究如何运行智能体程序;这里研究智能体如何操作文件系统、调度器、编译器、计算内核、网络和数据库。PithTrain-arXiv26、SysGPT-OSDI25 与 AutoMan-SOSP25 作为边界对照:它们分别让系统更易被智能体修改、只提供优化方法建议、以及不用大语言模型生成经验证系统代码。
截至 2026-08-20,本次沿 Auto-Research、AI-Infra、Agent-Systems、LLM 和 Optimize-Anything 的第一层链接核对 26 篇 wiki 论文;另用计算内核与智能运维综述交叉补缺。启用 --ingest-missing 后新增 8 篇全文页:SchedCP-arXiv25、INTA-arXiv25、D-Bot-PVLDB24、StorageXTuner-arXiv25、IDSTune-arXiv26、ACCLAIM-arXiv26、HarnessEngineering-arXiv26 与 KernelEvolve-ISCA26。外部检索还参考了计算内核生成综述和智能网络运维与智能 IT 运维综述,用于检查术语与遗漏,不用综述摘要替代原论文证据。
反复使用的术语统一如下:
| 术语 | 本文含义 |
|---|---|
| 智能体闭环 | 智能体提出制品或动作,系统执行并返回可改变下一轮选择的结果;不是把多个模型调用串起来。 |
| 验证器(verifier) | 检查候选是否满足语法、测试、形式命题或运行约束的组件;不同验证器强度不可混同。 |
| 评测脚手架(evaluation harness) | 封装环境、基线、输入、计时、正确性、资源限制、归档和晋升规则的可执行系统。 |
| 晋升合同(promotion contract) | 候选从试验状态进入可复用或可部署状态前必须满足的检查与指标。 |
| 搜索分母 | 总共生成、执行、拒绝和保留的候选数量,以及对应的模型词元、硬件小时和人类介入。 |
| 适用域(applicability domain) | 一条经验或配置成立的硬件、版本、工作负载和服务等级目标范围。 |
| 奖励欺骗(reward hacking) | 候选利用评测漏洞获得高分,却没有实现预期语义或在隐藏输入上失效。 |
| 样本外(out-of-sample,OOS)验证 | 使用搜索过程不可见的输入、工作负载、硬件或时间段检验候选,防止反复适应同一评测集。 |
| 应用程序接口(Application Programming Interface,API) | 系统向智能体暴露的受约束操作面;接口可调用不代表调用结果满足业务语义。 |
| P99 尾延迟 | 99% 请求都不超过的延迟,用于暴露平均值隐藏的少数慢请求。 |
研究版图
每个相关工作的定位
| 工作 | 做了什么 | 没做什么 | 关键观察 | 隐含假设 | 可攻击点 / 脆弱点 |
|---|---|---|---|---|---|
| SysSpec-FAST26 | 用功能、模块和并发三类半形式规约驱动多智能体生成并演化用户态文件系统(Filesystem in Userspace,FUSE) | 不生成可部署的内核文件系统;无崩溃一致性证明 | Ext4 的 82.4% 提交用于修复或维护,且多数改动局部 | 规约比 C 实现更易审查;局部依赖—保证推理(rely-guarantee)足以组合 | SPECFS 仅约 4,300 行且在用户态;规约错误会被整个生成链放大 |
| VibeTensor-arXiv26 | 让编程智能体在两个月内生成 C++、CUDA、自动微分和前端组成的深度学习运行时 | 不证明自治程度、生产性能或长期维护 | 局部组件测试通过仍可能组合成全局低效系统 | 测试与仓库结构能给智能体足够系统边界 | 端到端比 PyTorch 慢 1.7–6.2 倍;人工指导与失败分母不透明 |
| TritorX-MLSys26 | 从算子文档生成 MTIA Triton 封装层,并用静态格式检查器与 PyTorch 算子测试元数据(OpInfo)闭环修正 | 不优化内核性能,也不覆盖任意自定义算子 | 文档、示例和执行脚手架能弥补专有硬件语料缺口 | 抽样 OpInfo 足以代表算子语义 | 481 个算子通过不等于所有形状和数值边界正确 |
| VeriMoA-MLSys26 | 用多路径智能体和全局质量缓存从规格生成 Verilog | 不做完整芯片设计、时序收敛或流片验证 | 模型对 Python/C++ 熟悉度高于 Verilog,可借中间路径扩展候选 | 仿真测试和公开寄存器传输级(register-transfer level,RTL)基准足以筛出正确硬件 | 同源模型互评会传播错误;单次生成通过率(Pass@1)不覆盖功耗、性能和面积(power, performance and area,PPA)与物理实现 |
| NeuroSymbolicProof-OSDI26 | 让模型提出 seL4 Isabelle tactic,再由证明器、QuickCheck 和等价检查执行与修复 | 不生成系统实现,也不验证新规格是否表达了真实意图 | 证明状态与检查器反馈能提供比文本自评更强的稠密信号 | 历史证明轨迹能迁移到未完成目标 | 论文分母与百分比不能完全复算;成功只证明给定命题 |
| ACCLAIM-arXiv26 | 在 C、LLVM 中间表示和 x86 三层编排模型改写与编译器变换阶段 | 不覆盖并发、外部状态和大型系统代码 | 模型与编译器在高层语义和低层可靠变换上互补 | 每轮 15 个生成输入足以发现语义错误 | 100 个机会富集的 CodeNet 程序上均值 1.25 倍,收益集中在长尾;测试并非等价证明 |
| AlphaEvolve-arXiv25 | 用双模型、岛式种群和可执行评估器演化整文件程序,已用于 Borg 与计算内核 | 不自动构造可靠评估器,也不披露统一搜索成本 | 精确或数值可评估问题可把模型变成大规模变异算子 | 人类给定的搜索空间与评分代表真实目标 | 生产案例强,但搜索分母、人工选择和负结果不完整 |
| KernelEvolve-ISCA26 | 在 NVIDIA、AMD、MTIA 上用知识库、多粒度性能剖析与图搜索生成生产内核 | 不给统一搜索成本、误晋升率或组件等预算消融 | 缺算子会迫使中央处理器(Central Processing Unit,CPU)回退或服务分离,因此覆盖率是系统架构问题 | 参考测试与形状分派足以保护生产正确性 | “100% 正确”仅表示列出的 250 题和 480 个配置通过;内部编译器与数据难复现 |
| AccelOpt-MLSys26 | 在 Trainium NKI 上用束搜索(beam search)和从快慢候选提炼的优化记忆自我改进 | 不覆盖通信算子、多芯片和动态形状 | 新硬件缺少成熟启发式,单次模型也没有平台先验 | 14 个 NKIBench 内核和屋顶线模型(roofline model)峰值代表目标硬件价值 | 自建基准、手工基线不均;记忆可能过拟合 Trainium 代际 |
| PIKE-MLSys26 | 比较多智能体内核搜索中的探索、利用、错误修复和改动粒度 | 不进入真实推理服务,也不处理长期知识 | 在固定预算下,沿当前好候选做粗粒度利用优于广泛探索 | KernelBench 局部性能面存在可追踪梯度 | H100 上 2.88 倍相对微基准;动态形状、安全和端到端收益未测 |
| AdaExplore-arXiv26 | 从合成失败提炼跨任务 Triton 技能,再用保多样性树搜索优化内核 | 不定义技能版本、冲突和撤销语义 | 失败高度重复,可压缩成少量可迁移规则 | 合成任务的错误分布覆盖新任务 | 主要相对 PyTorch eager;跨硬件与跨 DSL 可能负迁移 |
| AVO-arXiv26 | 让编程智能体自行读谱系、查资料、修改和测试,连续七天推进 B200 attention 内核 | 不给多次独立运行、同预算搜索基线或完整模型配置 | 专家级优化需要数百次环境交互与持久谱系 | 单条最佳谱系可以代表方法能力 | 40 个提交来自 500 多方向;强最终结果无法分解监督和模型贡献 |
| CAKE-arXiv26 | 共同演化智能体可写、编译器可验证的硬件显式中间表示 | 不证明固定中间表示跨硬件泛化 | 结构化诊断与类型约束比直接 CUDA/PTX 更节省搜索 | 中间表示能覆盖目标调度且不会吞掉优化意图 | 编译器随任务继续扩展,后续收益可能来自累积人工知识而非抽象本身 |
| HarnessEngineering-arXiv26 | 以技能、基线、性能剖析、全量扫描和晋升门约束 B200 内核智能体 | 不声称无人自治,也不提供正式竞赛排名 | 高质量环境、参考和人类方向目前比纯自治搜索更可靠 | 低试次内环能在速度与正确性间取得可控平衡 | DSA top-k 的 3 次检查漏掉 200 次中 3 次的数值错误,直接反驳该假设 |
| LLaMEA-KernelTuner-MLSys26 | 让大语言模型进化生成自动调参算法,而非直接生成每个内核 | 不生成内核实现,也不覆盖动态生产流量 | 搜索策略本身可从应用和空间描述中自动设计 | BAT 四内核×六 GPU 足以代表调参器泛化 | 最佳生成算法可能对固定问题集过拟合;缺隐藏硬件与搜索成本 |
| GEPA-ICLR26 | 用执行轨迹和语言诊断反思演化提示与复合程序 | 不专门解决系统任务,也不保证任意反馈可信 | 可读诊断像近似梯度,能比标量奖励更高效 | 固定模型已有反思能力,验证集不被反复过拟合 | 系统问题若只有噪声性能分数,语言反馈可能只是自洽解释 |
| SchedCP-arXiv25 | 以模型上下文协议(Model Context Protocol,MCP)暴露工作负载分析、调度策略库和分层验证,让智能体生成或选择 sched_ext 策略 | 不覆盖实时、多租户、跨节点调度或长期漂移 | 目标推断与策略合成应分离,模型放控制面而非热路径 | 短期观测能恢复真实目标,金丝雀能暴露危险策略 | 仅三次重复和少量任务;安全漏检、回滚与错误目标没有实验 |
| StorageXTuner-arXiv25 | 用四智能体和可升降置信度的经验记忆调 RocksDB、CacheLib、InnoDB | 不调索引、查询或复制,不做在线无扰切换 | 少数经验支配搜索;新配置提案是主要错误源 | 自然语言经验的适用域能由摘要隐式携带 | 单机固定资源;相对默认的 575%–709% 可能放大收益,跨环境记忆未严格留出 |
| IDSTune-arXiv26 | 让旋钮、索引、物化视图专家并行推荐,由监督智能体消解冲突并经双层安全闸门发布 | 不提供配置事务、复制一致性或零停机上线 | 独立局部最优会相互冲突;筛选后的动态特征优于全量上下文 | 自然语言协商能找到主要交互,规则加模型可拦住危险组合 | 一周漂移仍是受控重放;2.98M 词元和 13.82 美元未计重放与物化成本 |
| INTA-arXiv25 | 以配置意图作中间表示,结合手册检索、增量翻译、语法树检查和模型语义报告 | 不证明多设备网络行为等价,也不自动部署 | 跨厂商命令需先恢复意图,确定性视图检查能修复大量错误 | 手册完整且单设备局部意图可组合 | 命令匹配 84.72% 仍有遗漏;12 份人工报告不足以估计危险漏检 |
| D-Bot-PVLDB24 | 从文档抽取诊断知识,匹配工具,再用树搜索和异步专家定位数据库根因 | 不执行修复,也不覆盖跨服务事故 | 链式推理会过早停止;外部知识和工具证据比模型记忆关键 | 十类注入根因和 PostgreSQL 视图代表真实事故 | 多根因人工评估准确率 66.9%,低于人类 80.6%;封闭根因集合有利于系统 |
| FlashInfer-Bench-MLSys26 | 用生产形状、隔离计时、正确性与 apply() 接口连接内核生成和服务集成 | 不提出新的搜索智能体 | AI 内核瓶颈常在评测与集成断层,而非生成能力 | 生产轨迹样本和专家 FlashInfer 基线代表部署 | 单一 B200 时代和有限模型;长运行回归与多租户更新未测 |
| SOL-ExecBench-arXiv26 | 用硬件理论上限和防投机检测评测 235 个 B200 内核任务 | 不生成候选,也不测完整服务 | 相对 PyTorch 加速与硬件效率几乎不相关,14.5% 提交有投机行为 | 分析上界对复杂内核足够准确 | 上界模型和检测器也可能有盲点;只覆盖 Blackwell |
| SysGPT-OSDI25 | 从系统优化论文归纳原则并微调建议模型 | 不自动生成、执行或验证补丁 | 历史论文的方法模式可被模型召回 | 论文标签与模型评审能代表真实优化帮助 | 没有端到端系统加速,因此是顾问而非系统工程智能体 |
| PithTrain-arXiv26 | 重新设计训练框架,使编程智能体更少绕过 registry、跨语言和隐式调用 | 不让智能体自动发现系统优化,也不测长程自治 | 软件结构会决定智能体修改成本 | 固定短任务能代表“面向智能体”的框架质量 | 最多减少 70% 轮数,但只固定一个编程智能体与短任务 |
| AutoMan-SOSP25 | 从 Dafny/TLA 规格生成经证明实现,并允许手工热点 refinement | 不使用大语言模型或开放式搜索 | 规格、证明义务和手工优化可分层组合 | 形式规格可承受开发成本 | 是强正确性对照,说明“多智能体”并非生成系统代码的必要条件 |
整体画面不是“模型越来越会写系统代码”,而是系统把开放式生成压缩进可执行、可测量、可回退的窄控制面。越接近生产,贡献越从提示与角色分工转向规格、工具 API、隐藏测试、性能剖析、知识版本、晋升合同和部署回滚。
外部关联工作与覆盖缺口
- LLM-NetCFG 与 Verified Prompt Programming探索意图到网络配置的生成和验证;前者更接近框架愿景,后者强调验证器,但都没有 INTA 的跨厂商完整手册检索与报告证据。
- KgEnt 是 SchedCP 之前的内核扩展智能体,证明模型可生成 eBPF 扩展,但没有 SchedCP 的稳定控制面、策略记忆和分层部署门。
- CompileAgent、SBLLM 与 KernelBench分别覆盖仓库编译工具调用、源码性能改写和计算内核基准;它们是 ACCLAIM 与当前内核智能体的上游,不都具备跨层或生产闭环。
- AgentTune、ELMo-Tune 与 λ-Tune 是数据库或存储调参基线;IDSTune 和 StorageXTuner 的主要增量是多组件协调、经验持久化和预执行验证,而不是第一次使用模型给配置。
- Experience Graphs把 KernelEvolve 的跨会话经验组织成图,报告达到目标加速快约 10 倍、词元少 52%;它解释了生产搜索为何需要版本化经验,但尚不能证明经验在硬件与工作负载漂移后不会负迁移。
矛盾与张力
-
规格约束与执行评测并非替代关系。 SysSpec-FAST26 假设更精确的半形式规格能在生成前压缩错误空间;AlphaEvolve-arXiv25、PIKE-MLSys26 与 StorageXTuner-arXiv25 更依赖执行后筛选。前者可能把错误写进规格,后者会反复适应有限评测;真正的生产路线往往需要规格限定允许空间,再由隐藏执行测试决定晋升。
-
“完全自治”与当前最强结果相冲突。 KernelEvolve-ISCA26 和 AlphaEvolve-arXiv25 展示生产价值,但评估器、搜索空间、知识和上线选择仍由专家设计;HarnessEngineering-arXiv26 更直接显示人机协作版本在五项中全部快于全智能体版本。现阶段自治主要发生在候选搜索内环,不发生在目标、验证合同和风险接受层。
-
微基准的清晰奖励与生产系统的多目标约束相冲突。 AdaExplore-arXiv26、PIKE-MLSys26 和 ACCLAIM-arXiv26 可按正确性与运行时间排序;SchedCP-arXiv25、IDSTune-arXiv26 和 INTA-arXiv25 还面对公平性、可用性、状态一致性和变更风险。越接近真实系统,单标量搜索越容易把未建模成本推向别处。
-
局部最优与组合正确性相冲突。 VibeTensor-arXiv26 的“Frankenstein effect”说明局部正确和局部高性能组件可组合成全局低效运行时;IDSTune-arXiv26 也显示独立最优的旋钮、索引和视图会彼此伤害。当前内核工作大多靠分派器组合局部胜者,尚未系统评估分派复杂度、编译缓存和长期维护税。
-
经验复用与环境漂移相冲突。 AccelOpt-MLSys26、AdaExplore-arXiv26、StorageXTuner-arXiv25 和 KernelEvolve-ISCA26 都将失败或成功压缩为记忆;IDSTune-arXiv26 又依赖动态特征应对漂移。没有显式适用域、失效检测和撤销语义时,“自我改进”也可能变成更自信的负迁移。
-
搜索吞吐与验证强度相冲突。 HarnessEngineering-arXiv26 的三次随机检查支持快速内环,却漏掉约 1.5% 的特定 top-k 边界失败;SOL-ExecBench-arXiv26 又发现 14.5% 提交会利用评测漏洞。把更多预算给候选生成会提高最佳分数,也会减少每个候选的证据深度。
-
模型泛化与工具合同稳定性相冲突。 SchedCP-arXiv25、INTA-arXiv25 和 KernelEvolve-ISCA26 都用稳定 API、手册或领域特定语言屏蔽底层变化;这些抽象一旦版本漂移,模型可能继续生成形式合法但语义过时的动作。更强模型不能自动修复错误工具、过期知识和错误权限边界。
脆弱假设
-
“测试通过即系统正确”。 来自 ACCLAIM-arXiv26、TritorX-MLSys26、KernelEvolve-ISCA26 和 HarnessEngineering-arXiv26。用隐藏输入、属性模糊测试、跨编译器或驱动重放、长时间并发和翻译验证组成分层测试;指标应包括隐藏失败率、首次失败时间、回滚率与验证成本,而不只是 pass@k。
-
“评测工作负载代表部署分布”。 来自 PIKE-MLSys26、AdaExplore-arXiv26、StorageXTuner-arXiv25 和 IDSTune-arXiv26。需要将搜索期、留出期和未来漂移期严格分开,使用生产轨迹的时间切片与未见硬件;报告 OOS 性能、负优化概率和尾延迟,而不是从固定基准取最佳值。
-
“自然语言经验可跨环境迁移”。 来自 AccelOpt-MLSys26、AdaExplore-arXiv26、StorageXTuner-arXiv25 和 KernelEvolve-ISCA26。构造硬件×版本×工作负载迁移矩阵,逐条记录经验来源、适用域和反例;指标是正迁移率、负迁移损失、错误经验撤销时间和跨会话节省的试验数。
-
“局部验证可以组合成完整系统”。 来自 SysSpec-FAST26、VibeTensor-arXiv26、IDSTune-arXiv26 和所有形状分派内核系统。需要组件单测通过后再做组合、故障和演化测试,特别检查跨模块不变量、并发交错、资源预算与旧版本状态;指标是组合后新缺陷密度与性能回归面。
-
“模型能正确恢复用户或应用目标”。 来自 SchedCP-arXiv25、INTA-arXiv25 和 D-Bot-PVLDB24。用含歧义、多目标、缺指标和故意误导信号的轨迹,让专家标注可接受目标集合;测目标误识别、应拒答而执行的比例,以及错误目标通过部署门的概率。
-
“更多搜索预算单调提高可信价值”。 来自 AlphaEvolve-arXiv25、AVO-arXiv26、CAKE-arXiv26 和 ACCLAIM-arXiv26。同时画出最佳性能、隐藏测试失败、候选多样性、模型词元、硬件小时和人工介入随预算变化的曲线;若只看最佳分数,无法区分真实进步与验证集过拟合。
产业动态
- Google DeepMind 报告 AlphaEvolve 已在 Borg 上持续回收约 0.7% 全球算力,并将 Gemini 的矩阵乘法内核加速 23%、使训练时间降低约 1%;后续又用于 TPU 电路、缓存替换和 Spanner 的分层合并整理(compaction),后者将写放大降低 20%。这些是已部署案例,但搜索成本和失败分母仍由企业内部掌握。AlphaEvolve 初始发布、后续影响报告
- Meta 已把 KernelEvolve-ISCA26 接入推荐系统内核工程,公开博客称 NVIDIA 上广告模型推理吞吐提高超过 60%、MTIA 上训练吞吐提高超过 25%,并服务数万亿次日常推理;论文比博客给出更多跨平台与测试证据,但外部仍无法重放内部编译器和生产数据。Meta 工程博客
- OpenAI 的内部产品实验将团队工作重心描述为“人设计环境、意图和反馈,智能体写代码”,报告约百万行智能体生成代码和约十分之一开发时间;这与 HarnessEngineering-arXiv26 的结论一致,但属于单团队工程报告,不是控制实验。Harness engineering
- NVIDIA 正在把相邻能力产品化:CUDA 13.3 的 CompileIQ 用进化与遗传算法调编译器内部参数,说明生产接受链偏好可重现、可移植的受限搜索;另一项 cuTile Python 到 Julia 的实验把规则、API 映射、示例、验证和测试封装成仓库内技能(repository skill),说明“技能加验证”正在成为厂商迁移工具。CompileIQ、cuTile 智能体迁移
- 数据库和网络方向尚未出现与 Google/Meta 内核路线同等级的公开生产闭环。D-Bot-PVLDB24、StorageXTuner-arXiv25、IDSTune-arXiv26、INTA-arXiv25 与 SchedCP-arXiv25 多为沙箱、设备实验或轨迹重放;产业落地最缺的不是生成器,而是变更事务、最小权限、金丝雀、回滚和事故责任边界。
候选空白
-
系统级隐藏验证集。 现有工作通常公开任务、基线和验证器,搜索可以反复适应同一表面。尚少有系统保留按时间、硬件、故障和输入语义分层的不可见二级门,并在论文中报告从内环通过到终检失败的条件概率。
-
验证预算调度。 HarnessEngineering-arXiv26 已暴露固定三次验证的漏检,但现有系统很少根据候选风险、数值边界、修改范围和历史失败自适应分配测试深度。搜索预算与验证预算通常各自给定,没有被联合优化。
-
经验的类型、版本与撤销。 优化记忆多是自然语言列表或文件知识库;尚缺统一表示去声明来源硬件、软件版本、负载形状、置信区间、反例和失效条件。没有这些字段,跨会话学习无法安全进入长期生产流程。
-
跨层制品的组合晋升。 计算内核、编译器变换阶段、运行时分派、数据库配置和系统代码分别被优化,但很少有一个晋升合同同时检查局部加速、端到端服务等级目标、故障恢复、资源预算和维护复杂度。VibeTensor 与 IDSTune 已提供局部最优互相伤害的反例。
-
带副作用系统动作的事务语义。 网络配置、数据库物理设计和内核策略不是纯函数;当前工作多在沙箱测试后直接讨论部署,缺少跨多个动作的准备、提交、中止、补偿和版本回滚抽象。
-
目标不确定时的拒绝与升级。 D-Bot 会给报告,INTA 保留人工复核,SchedCP 更接近自动部署;但尚缺统一研究来决定证据不足时应继续探测、拒绝动作、请求人类还是执行保守回退,并量化错误升级与错误自治的代价。
-
总成本和搜索分母可比性。 论文常报告最终加速、少量模型账单或开发时间,却不同时披露候选数、失败类别、模型词元、硬件小时、人工引导、测试成本、部署成本和盈亏平衡调用量。因而无法判断 2% 内核加速与 30% 配置加速哪一个实际值得搜索。
关键未知
-
不同验证器到底能拦住什么错误? 在同一组系统变异上依次运行语法检查、单元测试、模糊测试、模型复核、形式验证和金丝雀,测每层独立召回、增量召回、误报与成本。
-
经验何时从正迁移变为负迁移? 对相同任务跨硬件代际、编译器版本、工作负载和模型后端重放,绘制迁移收益矩阵,并将性能反转点与经验适用域字段关联。
-
智能体搜索是否真的优于经典搜索? 固定候选执行次数、硬件时间和先验知识,对比贝叶斯优化、进化算法、编译器自动调优器、单模型迭代和多智能体;同时报告最佳值、达到阈值的时间和隐藏失败率。
-
模型更强后,脚手架价值会缩小还是上升? 固定同一评测脚手架,在至少三代模型上逐步移除知识、专用工具、检查器和人类方向,测能力替代与互补,而不是只比较最终模型排行榜。
-
微基准加速能以多高概率传到端到端? 将同一候选依次放入算子、图、单请求、并发服务和生产轨迹重放,测各层加速相关系数及瓶颈迁移;特别记录“内核更快、服务不变或更慢”的比例。
-
系统变更如何安全回滚? 对调度策略、网络配置、数据库物理设计和生成代码注入进程崩溃、网络分区、验证器误判与部分提交,测恢复点目标、恢复时间目标、重复副作用和状态泄漏。
-
开放式目标推断有多可靠? 构造包含多目标冲突、缺失指标与错误遥测的工作负载,让智能体输出目标、置信度和下一步动作;以专家可接受集合评估,而非强迫一个唯一答案。
-
何时经济上值得运行智能体搜索? 对每个产物计算总搜索成本、预计调用量、节省资源、维护和回归成本,得到盈亏平衡曲线;生产论文应报告实际调用分布,而非只给峰值加速。