APICheck 交流群 · 欢迎加入讨论
QQ 群二维码
群号: 1058136854

使用 QQ 扫一扫上方二维码即可加群

检测方法论

检测 方法

公开评分组成、探针范围、版本说明与已知局限

公开评分组成

综合分如何由探针得分加权得出

综合分 = 各探针得分(0–100)按权重加权平均。单项探针 ≥90% 通过、≥50% 部分通过、否则未通过。

协议与结构
25%
身份一致性
19%
安全合规
16%
性能稳定
15%
内容质量
12%
能力指纹
12%

探针范围

共 19 项探针,分为 6 大类别

安全合规

HTTPS 传输、Token 注入、提示词防提取、指令劫持与错误信息泄露。

SEC 传输安全S1 Token 注入S3 指令覆盖S4 错误信息泄露

协议与结构

API 能否连通、响应是否符合 OpenAI 兼容格式、心跳与签名字段是否完备。

D1 协议连通性HB 接口心跳D2 响应结构D17 响应签名D18 缓存字段完备性D19 文档识别

身份一致性

返回 model 字段与模型自报身份是否一致,是否存在偷换模型迹象。

D3 身份一致性D11 隐式身份与包装审计

内容质量

指令遵循、Canary 回显、Tool Use 等内容质量与结构化能力。

D5 内容 CanaryD7 结构化输出

性能稳定

流式 TTFT、端到端延迟、多次采样稳定性与 SSE 流完整性。

D8 响应时延D9 性能稳定性S5 流完整性

能力指纹

多模态视觉、JSON 约束、逻辑推理、长上下文与代码生成等能力真实性指纹。

D13 多模态D16 能力指纹

版本说明

评分公式与探针集合的版本演进

评分公式版本

当前版本:v2.0。公式为加权平均,权重根据探针 maxScore 动态计算。若探针集合变更,权重会自动重新归一化。

探针版本

探针集合定期更新以应对模型能力演进与渠道包装变化。每次变更会通过版本号与变更日志公示。

局限

检测结果的使用边界与注意事项

样本偏差

检测结果基于特定时间窗口的样本,可能受网络波动、服务商临时限流或负载均衡影响,不代表长期稳定表现。

模型不确定性

部分模型具有随机性或版本差异,同一模型多次检测结果可能存在细微波动,能力指纹探针仅反映检测时刻状态。

渠道多样性

不同渠道(官转、Max、逆向等)的合规性与稳定性差异较大,同一服务商的不同渠道分组可能表现不同。

想看一份应用这套方法的真实报告?

查看示例报告,直观感受检测方法论如何在结果中体现。

查看完整示例报告