检测方法论
检测 方法
公开评分组成、探针范围、版本说明与已知局限
公开评分组成
综合分如何由探针得分加权得出
综合分 = 各探针得分(0–100)按权重加权平均。单项探针 ≥90% 通过、≥50% 部分通过、否则未通过。
协议与结构
25%
身份一致性
19%
安全合规
16%
性能稳定
15%
内容质量
12%
能力指纹
12%
探针范围
共 19 项探针,分为 6 大类别
安全合规
HTTPS 传输、Token 注入、提示词防提取、指令劫持与错误信息泄露。
协议与结构
API 能否连通、响应是否符合 OpenAI 兼容格式、心跳与签名字段是否完备。
身份一致性
返回 model 字段与模型自报身份是否一致,是否存在偷换模型迹象。
内容质量
指令遵循、Canary 回显、Tool Use 等内容质量与结构化能力。
性能稳定
流式 TTFT、端到端延迟、多次采样稳定性与 SSE 流完整性。
能力指纹
多模态视觉、JSON 约束、逻辑推理、长上下文与代码生成等能力真实性指纹。
版本说明
评分公式与探针集合的版本演进
评分公式版本
当前版本:v2.0。公式为加权平均,权重根据探针 maxScore 动态计算。若探针集合变更,权重会自动重新归一化。
探针版本
探针集合定期更新以应对模型能力演进与渠道包装变化。每次变更会通过版本号与变更日志公示。
局限
检测结果的使用边界与注意事项
样本偏差
检测结果基于特定时间窗口的样本,可能受网络波动、服务商临时限流或负载均衡影响,不代表长期稳定表现。
模型不确定性
部分模型具有随机性或版本差异,同一模型多次检测结果可能存在细微波动,能力指纹探针仅反映检测时刻状态。
渠道多样性
不同渠道(官转、Max、逆向等)的合规性与稳定性差异较大,同一服务商的不同渠道分组可能表现不同。
