开发者 / JevModel

Jev 概率、置信度与人工复核阈值

区分 Choice 置信度、Noul 概率与 Score 量表;在自动化决策前,用标注数据评估阈值。

最近更新:

置信度和概率相同吗?

不同。Jev 的 probabilities 描述类型化答案的分布,confidence 汇总其集中程度。TypeSafe 文档中的 Choice 公式为:n 个标签、最高概率 p 时,confidence = (p - 1/n) / (1 - 1/n)。示意三标签概率为 0.90、0.06、0.04 时,置信度为 0.85。置信度不是独立测量的准确率。JevModel 透传上游答案,使用前应验证实际字段。

如何用 JevModel API 分类文本Choice、Score 与 Noul

Noul 与 Score 有什么不同?

Noul 的 noul 字段是“是”的概率,上游不另给 confidence 字段;接近 0.5 时说明对该二元问题不确定。Score 评估有序等级,可能返回小数;评分本身不是概率。应依据量表解释 Score,并检查实际返回的分布和置信度。

用清晰量表评估线索Choice、Score 与 Noul

分类器何时应暂不判断?

将模糊输入、不支持的主题、格式错误的响应和服务错误交给复核。适当时加入明确的 review 标签,但不能假设模型总会选对它。自动分流须验证标签,并使用针对该问题评估过的阈值。前两项概率接近可能反映歧义。即使模型自信,敏感动作仍须保留确定性权限控制与人工确认。

用 Jev 进行客服分流在工具调用前增加判断关口Jev AI 决策流与人工复核分支

如何选择阈值?

将说明调优、阈值选择和最终独立测试分开。对已标注输入,同时报告自动接受案例的错误率和覆盖率,即复核后仍可自动化的案例比例。分别检查各类别及少见但代价高的错误。可靠性图和 Brier 分数可评估概率校准;评估 probabilities,不要把 confidence 当成正确概率。标签、说明或上游模型行为变化后重新评估,本站不保证某个通用阈值有效。

评估 Jev 工作流Jev API 批量文本分类:CSV 与 JSONL

JevModel 为独立项目,与 TypeSafe AI 无关联。