応答の型が正しくても Jev の制限は重要です。公式の Jev 1.13 文書は、数値精度、日付比較、間接推論、敵対的入力に弱点があると説明しています。これらはバージョン固有の観察で、将来の全モデルに当てはまるとは限りません。
型安全は何を保証する?
構造化された回答はコードで扱いやすくなりますが、選択の正しさを保証しません。選択肢が請求と営業だけなら、技術的な問題には適切な出口がありません。必要な選択肢を用意し、入力、出力、権限をモデルとは独立に検証します。
文章生成や画像の読み取りは?
Jev は文章生成モデルではありません。説明、メール、要約には生成モデルを使います。現在は文字列、オブジェクト、配列に含まれるテキストを扱います。画像、音声、動画、バイナリには別の前処理が必要で、その誤りが判断に影響することもあります。
正確な計算や日付比較は?
公式文書は、正確な数え上げ、算術、日付順序を Jev に任せないよう勧めています。請求日の前後関係は日時解析と比較コードで処理します。曖昧な入力で候補を選んだり不確かさを検知したりする場合も、最後はコードで検証・計算します。
長い文脈で悪化する理由
文脈が上限内でも、無関係な state は注意をそらします。必要な内容を検索し、重複や不要な情報を除いてください。合計 64k と state+最長質問 32k は入力上限であり、全長で同等の精度を保証するものではありません。
プロンプト注入や曖昧な基準
悪意ある文章は判定を誘導する可能性があります。state を信頼できない入力として扱い、条件を正確に定義し、注入指示や境界例を試します。instructions と criteria の矛盾を避けてください。安全性に関する質問は対策の一部であり、攻撃が失敗する保証ではありません。
confidence は正解率と同じ?
違います。Choice の confidence は確率の集中度と選択肢の数に依存し、選択した項目の確率と同じではありません。Score には別の意味があり、Noul は「はい」の確率を返します。全質問に同じしきい値を流用せず、ラベル付きデータで確認ルールを決めます。
6 言語で同じ精度?
サイトの 6 言語対応はモデル評価ではありません。TypeSafe は英語が主な学習言語で、現時点で最も良いと説明しています。実際の非英語文、混在言語、否定、俗語、専門語でテストしてください。当サイトは多言語の実測比較を公開していません。
運用前のテスト
通常、曖昧、悪意ある、対象外の入力を含む小さなラベル付きセットを用意します。モデル ID、質問、正解ラベル、誤りを記録し、人に回す条件を決めます。タイムアウトとサービス停止時の代替処理を設け、モデルや基準が変わるたびに再評価します。