开发者 / JevModel

评估 Jev 工作流

在自动化前测试标签、不确定性和真实结果。

建立标注样本

收集实际流程中的代表性状态,包括模糊和少见案例。让复核人员独立标注目标分支,并将测试数据与用于修改说明的示例分开。

衡量实际决策

按类别检查准确率、按概率区间检查校准情况,同时观察回退比例和后续结果。阈值应考虑不同错误的代价。问题措辞、模型版本或输入分布变化后,都应重新评估。

JevModel 为独立项目,与 TypeSafe AI 无关联。