Los casos de uso de Jev funcionan mejor cuando el modelo toma una decisión concreta y el código controla el flujo. Dale el texto necesario, define la forma de la respuesta y valida el resultado antes de actuar. Estos ejemplos son diseños de aplicaciones, no mediciones independientes de rendimiento.

¿Qué puedes construir con Jev?

1. Clasificación de tickets

Entrada: Un cliente indica que la integración de pagos falla repetidamente.

Decisión del modelo: Choice elige facturación, soporte técnico, ventas o revisión.

Acción y límite: El código asigna el ticket y conserva una vía de revisión humana. Un mensaje puede afectar a varios equipos: define el responsable principal o haz preguntas separadas.

2. Moderación de contenidos

Entrada: Un comentario y una norma comunitaria breve y explícita.

Decisión del modelo: Noul estima si el comentario incumple esa norma concreta.

Acción y límite: Envía los casos dudosos a revisión y registra la norma evaluada. Las citas, el sarcasmo y los textos hostiles pueden alterar el juicio. Una puntuación no sustituye toda la política de moderación.

3. Relevancia de consultas comerciales

Entrada: Una consulta y los usos documentados del producto.

Decisión del modelo: Score aplica niveles ordenados: sin relación, ajuste parcial y ajuste directo.

Acción y límite: Prioriza la bandeja para seguimiento humano. La falta de datos no demuestra falta de encaje. Evita inferir características personales o decidir la elegibilidad mediante el score.

4. Reordenación de resultados

Entrada: Una consulta y un fragmento ya recuperado por tu buscador.

Decisión del modelo: Score evalúa si el fragmento responde directamente a la consulta.

Acción y límite: El código ordena los candidatos, con una pregunta por fragmento cuando sea útil. Jev no obtiene los documentos y el contexto irrelevante puede reducir la precisión.

5. Comprobación de citas

Entrada: Una afirmación y el pasaje exacto que se cita.

Decisión del modelo: Choice elige respaldada, contradicha o evidencia insuficiente.

Acción y límite: Marca citas débiles antes de mostrar la respuesta generada. Esto comprueba el apoyo en el texto proporcionado, no la veracidad de la fuente en sí.

6. Selección de agentes y herramientas

Entrada: Una petición, descripciones de herramientas permitidas y contexto de la aplicación.

Decisión del modelo: Choice elige una herramienta, una aclaración o ninguna acción.

Acción y límite: La aplicación comprueba permisos y argumentos antes de ejecutar. Que el modelo elija una herramienta no concede permiso para usarla. Incluye una ruta para solicitudes no admitidas.

¿Qué tipo de pregunta conviene?

Choice sirve para alternativas excluyentes, Score para niveles descriptivos ordenados y Noul para un criterio sí/no. Un ticket puede generar un Choice de departamento y un Noul separado de urgencia. No mezcles la urgencia con el nombre del departamento.

¿Qué debe seguir en el código?

La autenticación, la aritmética exacta, las fechas, la búsqueda y las acciones pertenecen al código convencional. Comprueba los valores permitidos, registra la versión y evalúa muestras etiquetadas antes de fijar umbrales. Una respuesta con alta confianza también puede ser errónea.

¿Cómo se estima el coste?

Mide usage.input_tokens en llamadas representativas con preguntas reales, y multiplica por el volumen y la tarifa. Suponiendo 1.000 tokens, una llamada cuesta 0,000042 USD al precio verificado; 100.000 llamadas cuestan 4,20 USD, sin incluir el resto de la aplicación.

Sigue leyendo

Resumen · Precios · Primeros pasos · Limitaciones

Fuentes y otras lecturas