即使响应的类型完全正确,Jev 的限制仍然重要。官方 Jev 1.13 说明记录了数值精度、日期比较、间接推理和对抗输入方面的弱点。这些结论针对特定版本,不能永久套用到所有未来模型。

“类型安全”到底保证了什么?

结构化答案更方便代码消费,但不保证选择在事实上正确。如果选项只有账单和销售,技术故障仍然需要出口;应提供合适选项并评估结果。输入、输出和权限都需要独立于模型进行验证。

Jev 能写回复或看图片吗?

Jev 不是文本生成模型。解释、邮件和摘要需要生成式模型。当前模型接受文本,可以是字符串、对象或数组中的文本值。图片、音频、视频和二进制必须先用其他工具预处理,转换误差也可能传递到后续判断。

能精确计数、计算或比较日期吗?

官方不建议依赖 Jev 做精确计数、算术和日期排序。例如,比较哪张发票日期更早,应由日期解析和比较代码完成。遇到含糊输入,模型可以辅助选候选值或标记不确定性,最终验证与计算仍在代码中完成。

为什么上下文更长,结果反而可能更差?

即使没有超出窗口,无关 state 也可能分散模型注意力。先检索所需内容,再移除重复记录。64k 总输入和 32k 的 state 加最长问题预算只是请求限制,不保证整个窗口内始终保持同等准确率。

如何看待提示注入和模糊条件?

恶意文本可能影响判断。应把 state 当作不可信数据,精确描述条件,测试注入指令和边界案例,避免 instructions 与 criteria 相互矛盾。审核或安全判断只是应用中的一道措施,不能保证恶意输入永远无效。

置信度等于正确率吗?

不等于。Choice 的 confidence 反映选项概率的集中程度,并与选项数量有关,不能直接当作被选中选项的概率。Score 有自己的置信度语义,Noul 返回“是”的概率。应根据自己的标注样本校准人工复核规则,不要把一个阈值照搬到所有问题类型。

六种语言的效果一样吗?

网站提供六种语言,不代表已做模型多语言评测。TypeSafe 表示英语是主要训练语言,目前表现最好。需要测试真实的非英语文本、混合语言、否定、俚语和专业词汇。本站尚未发布实测中英文或六语言比较。

投入使用前应该测试什么?

准备含正常、模糊、恶意和超范围输入的小型标注集,记录精确版本、问题、预期标签和错误案例。决定哪些错误必须交给人工,设置超时和服务不可用时的兜底,并在模型或 criteria 变化后重复评估。

继续阅读

模型概览 · 应用场景 · 价格说明 · 快速入门

资料来源与延伸阅读