公开记录中的每个仓库都带有一个健康指数:一个介于 1 与 100 之间的整数,概括公开可见的工程、维护、安全与治理实践。该指数的存在,是为了让一个库能与其替代品一目了然地比较——但它是一个完全透明的层级结构的顶端,绝不是黑箱。
三级层级结构
指数经由三个有文档记录的层级逐级汇总:
- 组成部分——单个可观察的事实(许可证文件存在、最新发布版本于 40 天前交付、巴士系数为 3)。每个组成部分在其指标内部承载固定权重。
- 指标——组成部分的加权和,各为 1–100 的整数。例如: 开发活跃度、 维护者韧性、 安全态势。
- 类别——其下指标的加权平均,同样在 1–100 之间。六个加权类别为活力、 社区与采用、 可持续性与治理、 工程质量、 安全,以及权重刻意设得很小的 AI 就绪度。
总健康指数先取可用类别的加权平均:
一项指标在总指数中的有效权重为类别权重 × 类别内权重。每份报告都在每张指标卡片上显示该数字,且每个公布的数值都映射到七个 评级等级之一。
依据公开记录的校准
加权平均随后经由一条固定的单调曲线校准到公布的指数量表上,该曲线锚定于公开记录的经验分布。校准正是各等级具有百分位含义的原因 ——*卓越*确实是记录中的最高层级——它也让指数得以使用完整的 1–100 量程,而不是把一半的记录挤在其中的二十分里。曲线在顶端饱和:原始加权平均达到 91 及以上即公布为 100,这也是一个没有任何 AI 就绪度信号(占原始权重 4%)的仓库仍能达到 100/100 的原因。原始加权平均始终保留在每份报告的 overall.inputs.weighted_overall_raw 中,因此整个算术过程保持完全可审计。类别与指标数值按未校准的形式公布——该曲线仅描述并拟合总指数本身。
风险信号为指数设定上限
有四项政策位于加权平均之外。它们都不会奖励干净的结果——没有任何发现的仓库只是保留其校准后的指数——但一项确认的发现会对已发布的数值施加乘数,并在最严重的情形下将其压在一个明示的上限之下:
| 政策 | 作用对象 | 上限 |
|---|---|---|
| 恶意依赖 | 安全态势与总指数 | 19——*危急*的上沿 |
| 弃置 | 总指数 | 疑似为 34,已声明为 19 |
| 高风险司法辖区暴露 | 安全态势与总指数 | 34——*存在风险*的上沿 |
| 增长真实性 | 流行度中的星标与复刻组成部分 | 无 |
自方法论 v1.13.0 起,各项政策不再叠加。触发的最严格的一项独自起作用,其余照常报告但不再改动数值:乘数表明一项发现有多严重,而被连乘两次的数值是任何政策都未曾选定、也无人能解释的数字。证据无法回答某项政策所提问题的仓库读作未核实,绝不会因这一缺口而被扣分。
缺失数据绝不按零计入
当某个组成部分的底层数据不可用——注册表不发布下载数字、贡献者名单无法采样——该组成部分被排除,其余权重重新归一化。同一规则向上一级同样适用:没有数据的指标变为 null,其类别重新分配权重;没有任何可评分指标的类别则从总指数中剔除。
这条规则是公平性的核心。项目只在实际可观察的范围内被度量,证据的缺席被如实报告为缺席——指标的 note 字段记录每一次重新归一化,读者因此始终知道哪些被度量了、哪些没有。
如何阅读报告
- 读画像,而不只是读数字。各类别均衡构成的 74 分,与掩盖着 25 分安全数值的 74 分,是截然不同的命题。报告中的雷达图使尖峰与凹陷并存的画像即刻可见。
- 核对等级。数值映射到从
exceptional到critical的七个标准化等级;等级阈值是版本化方法论的一部分。 - 任何数值皆可重算。每项指标都在报告中回显其输入与逐组成部分的得分,因此任何公布的数值都可以依据 JSON 报告的
data部分手工验证。 - 候选项应相互对照着读。指数只有放在实际考虑中的替代品旁边才有意义。对比视图把至多六条记录放在同一组坐标轴上—— 类别画像、增长轨迹以及每一项底层数字——因此它们之间的差距是可见的,而不是靠推断的。
版本管理
公式、权重与等级阈值作为整体进行版本管理。任何变更都会提升每份报告所记录的指标版本号,完整历史公开可查——参见 方法论版本。方法论的部分环节可以按扫描逐一关闭;报告随之准确记录哪些被禁用——参见 扫描配置。