Jev 最适合负责一个范围明确的判断,程序负责整个工作流。先给出回答问题所需的文本,再定义允许的答案形式,最后由代码验证并执行动作。下面是应用设计示例,不是本站独立测得的性能结果。

可以用 Jev 构建什么?

1. 客服工单分类

输入: 客户表示支付集成反复失败。

模型判断: 用 Choice 在账单、技术支持、销售和需要复核之间选择。

程序动作与边界: 代码把工单分派到队列,同时保留人工复核入口。一条消息可能涉及多个团队,需要明确主责规则,或拆成多个问题。

2. 内容审核

输入: 一条评论,以及简明、明确的社区规则。

模型判断: 用 Noul 评估评论是否违反某一条具体规则。

程序动作与边界: 将不确定情况交给人工,并记录所评估的规则。引用、反讽和恶意输入都可能影响判断;不要让一个分数代替完整审核流程。

3. 销售咨询相关性评分

输入: 一条咨询,以及产品已公开的适用场景。

模型判断: 用 Score 按无关、部分相关、直接匹配等有序描述评分。

程序动作与边界: 排序收件箱,方便人工跟进。缺少信息不等于不匹配;不要推断个人特征或用分数决定资格。

4. 检索结果重排

输入: 一个查询,以及搜索系统已找到的候选段落。

模型判断: 用 Score 判断段落回答查询的直接程度。

程序动作与边界: 程序对候选项排序,必要时为每段内容单独提问。Jev 不负责抓取文档;混入过多无关上下文也可能降低准确率。

5. 引用支持性检查

输入: 一个论断,以及对应的原始引用段落。

模型判断: 用 Choice 选择支持、矛盾或证据不足。

程序动作与边界: 在展示生成答案前标记较弱的引用。这只能判断给定文本是否支持论断,不能证明来源本身是真实的。

6. Agent 与工具路由

输入: 用户请求、允许使用的工具说明和应用上下文。

模型判断: 用 Choice 选择某个工具、请求澄清或不执行。

程序动作与边界: 实际调用前由程序检查权限和参数。模型选中了工具,不代表获得了执行权限;应为不支持的任务设置明确出口。

如何选择问题类型?

互斥的类别用 Choice,有序的描述等级用 Score,是非条件用 Noul。例如,同一工单可以分别产生部门 Choice 和紧急程度 Noul,不要把紧急程度硬塞进部门标签。

哪些逻辑应该保留在代码中?

身份验证、精确算术、日期比较、文档检索和实际操作应由普通代码完成。执行前检查结果是否在允许集合中,记录返回的模型版本,并用自己标注的样本决定阈值。高置信度答案也可能出错。

如何估算成本?

用包含真实问题的代表性请求测量 usage.input_tokens,再乘以预计请求量和当前单价。假设每次输入 1,000 token,核查时单次模型费用为 0.000042 美元,100,000 次为 4.20 美元,不含应用其他开销。

继续阅读

模型概览 · 价格说明 · 快速入门 · 模型限制

资料来源与延伸阅读