只有当模型、端点、版本、参数、失败状态和成本都被记录时,多平台结果才具备可比性。网关的价值不是隐藏上游,而是让采样协议、健康状态、配额和审计更加透明。
为什么多模型采样需要专门治理
AI 可见性任务通常横跨多个平台和模型。不同提供方的接口协议、搜索能力、上下文限制、响应结构、限流策略和计费方式并不相同。若只做统一的“文本输入—文本输出”,很容易丢失模型版本、引用字段、错误码和搜索状态。
更严重的问题是静默降级:主模型失败后自动切换到其他模型,却仍被统计为原平台结果;或网络超时后只重试成功样本,最终让报告看起来比真实运行更稳定。治理首先要保证实验身份不被路由逻辑破坏。
五层运行模型
提供方登记
记录官方接口、自托管服务或受控连接的能力、协议和生产状态。
分层健康检查
区分网络可达、鉴权有效、模型可用、搜索能力和响应质量。
任务路由
按平台研究、内容分析或辅助任务选择允许的端点,禁止跨平台伪装。
限额与熔断
按租户、项目、批次和提供方控制并发、QPS、预算和失败阈值。
证据审计
记录请求身份、参数摘要、响应状态、引用字段、用量和重试链路。
能力状态
明确 ready、partial、blocked、disabled 与 dev_only,避免实验能力被当成生产承诺。
质量优先于“请求成功”
HTTP 200 只说明端点返回了内容,不说明样本有效。AIRank 将质量检查拆成四类:回答是否完整、是否真正启用搜索、引用字段是否可解析、内容是否符合当前问题和语言。空泛回答、错误语言、截断响应和伪引用都应进入质量失败。
| 状态 | 含义 | 处理方式 |
|---|---|---|
| 运行成功 | 协议与内容质量均通过 | 进入正式样本 |
| 运行失败 | 超时、限流、鉴权或服务异常 | 保留错误并按策略重试 |
| 质量失败 | 响应存在但不可用于比较 | 单独统计,不伪装成有效回答 |
| 能力缺失 | 端点不支持目标搜索或引用能力 | 标记 blocked 或 disabled |
| 协议变更 | 字段、模型或终端行为改变 | 暂停同口径趋势,建立新基线 |
成本、配额和实验完整性
成本治理不能靠采样结束后看总账。每个任务在执行前应有样本预算,执行中按平台和批次累积用量,超过阈值时暂停或降频,并明确说明样本完整性受到了什么影响。
降级也必须有边界。辅助摘要或分类任务可以在等价模型间路由,但用于“某个平台如何回答”的正式采样不能切换成另一平台。否则节省了成本,却破坏了研究对象。
最便宜的请求不一定产生最低成本
低价但高失败率、缺少引用字段或需要大量重试的端点,可能带来更高的人工核验和报告返工成本。AIRank 以有效样本成本,而不是单次调用价格评价运行效率。
AIRank 如何把基础设施能力收敛为产品
- Provider 健康面板:展示端点可用性、延迟、搜索与引用能力,而不是对外宣传具体供应商排行。
- 采样协议锁定:正式项目冻结平台、模型、参数和证据格式,变更时自动建立新版本。
- 质量阻断:不合格响应不会悄悄进入指标,失败原因保留在报告完整性中。
- 项目级成本:将调用量、重试、有效样本与成本绑定到客户、项目和复测批次。
- 审计轨迹:每条结论可追溯到任务、连接、请求状态和原始响应。
这使 AIRank 能持续扩展平台覆盖,同时不牺牲证据口径。平台数量只是覆盖面,稳定、透明和可复查才是企业级产品的基础。
方法来源与 AIRank 再产品化
本文吸收多上游健康检查、路由、熔断、配额、用量与审计的工程思路,但 AIRank 只将其作为内部模型基础设施层,产品前台仍围绕品牌问题、回答证据和复测结果。
- TokHub:AI 服务连接、分层探测、OpenAI 兼容网关、配额、熔断与审计。
- yao-geo-skills:多平台采样、失败样本和可验证交付方法。