Las limitaciones de Jev importan aunque la respuesta tenga el tipo correcto. Las notas oficiales de Jev 1.13 describen debilidades en precisión numérica, comparación de fechas, razonamiento indirecto y entradas hostiles. Son observaciones de esa versión, no afirmaciones sobre todos los modelos futuros.
¿Qué garantiza la seguridad de tipos?
Una respuesta estructurada facilita su uso en código, pero la opción elegida puede ser incorrecta. Si solo ofreces facturación y ventas, un problema técnico no tiene una buena ruta. Añade alternativas adecuadas y valida entradas, salidas y permisos independientemente del modelo.
¿Puede redactar o leer imágenes?
Jev no genera texto libre. Usa un modelo generativo para explicaciones, correos y resúmenes. El modelo actual acepta texto como cadena o valores de texto dentro de objetos y listas. Imágenes, audio, vídeo y binarios requieren preprocesamiento, cuyos errores pueden afectar a la decisión.
¿Puede contar, calcular o comparar fechas?
La documentación desaconseja confiar en Jev para conteos exactos, aritmética y orden de fechas. Compara fechas de facturas con analizadores y código. El modelo puede ayudar a elegir un candidato ambiguo o señalar incertidumbre; el código debe validar y calcular el valor final.
¿Por qué más contexto puede empeorar el resultado?
Un state irrelevante puede distraer aunque quepa en la ventana. Recupera solo lo necesario y elimina duplicados. Los presupuestos de 64k totales y 32k para state más la pregunta más larga son límites de tamaño, no garantías de precisión constante.
¿Qué ocurre con la inyección de instrucciones?
El texto hostil puede desviar un juicio. Trata state como datos no fiables, define condiciones precisas y prueba instrucciones inyectadas y casos límite. Evita contradicciones entre instructions y criteria. Una pregunta de seguridad es un control del sistema, no una protección absoluta.
¿Confidence equivale a corrección?
No. En Choice, confidence depende de la concentración de las probabilidades y del número de opciones; no es la probabilidad de la opción seleccionada. Score tiene su propia semántica y Noul devuelve una probabilidad de sí. Calibra la revisión con ejemplos etiquetados y no copies un umbral entre todos los tipos de pregunta.
¿Funciona igual en seis idiomas?
Seis idiomas del sitio no constituyen una evaluación del modelo. TypeSafe indica que el inglés es la principal lengua de entrenamiento y actualmente la mejor. Prueba textos reales, mezclas de idiomas, negaciones, jerga y vocabulario especializado. No hemos publicado una comparación multilingüe medida.
¿Qué probar antes de usarlo?
Prepara un conjunto etiquetado con entradas normales, ambiguas, hostiles y fuera de alcance. Registra versión, preguntas, etiquetas esperadas y errores. Define la revisión humana, tiempos máximos y alternativas ante fallos del servicio. Repite la evaluación cuando cambien el modelo o los criterios.
Sigue leyendo
Resumen · Casos de uso · Precios · Primeros pasos