COMPARATIVA DE JEV · JEVBENCH V1.3.0 · ACTUALIZADO EL 22 DE SEPTIEMBRE DE 2026

Jev frente a Laya

Un modelo que ajustas con tus datos frente a otro que funciona desde el primer momento.

En este sitio

Jev 1.13.0

TypeSafe · modelo System One

74.4

Listo desde el primer día, sin datos etiquetados ni entrenamiento.

JevBench v1.3.0 · puesto n.º 1
vs.

Alternativa

Laya

Convai Innovations · Apache-2.0 · cabeza de decisión de 421 M

54.4

Pesos abiertos, decenas de milisegundos y uno de los sistemas más baratos de ejecutar.

JevBench v1.3.0 · puesto n.º 33
API alojada
DÓNDE SE EJECUTA
Alojamiento propio con pesos Apache-2.0
Funciona tal cual
SIN AJUSTE FINO
Necesita ajuste fino para cada tarea
Inglés; menor fiabilidad en otros idiomas
IDIOMAS
Inglés y más de 100 idiomas
64.000 tokens por solicitud
VENTANA DE CONTEXTO
512 tokens por pregunta
74,1% de aciertos
CASOS DE PRUEBA MÁS DIFÍCILES
34,1% de aciertos
0,65 s de mediana en la API alojada
TIEMPO DE RESPUESTA
33–40 ms en una Tesla T4

El benchmark

JevBench v1.3.0, medido en las mismas condiciones

Un benchmark evaluó los 52 sistemas con el mismo método; por eso estas barras son comparables entre sí, a diferencia de las cifras de los proveedores. La puntuación combina inteligencia, calibración, velocidad y coste.

Puntuación compuesta

Más alto es mejor

JevBench v1.3.0

#1 Jev
74.4
#2 SemIf
73.1
#3 djev
73.0
#11 OpenJev
66.4
#33 Laya
54.4

Los tres primeros quedan a menos de 1,4 puntos entre sí y después la clasificación cae con fuerza. La puntuación compuesta oculta las diferencias reales, por eso los dos gráficos siguientes la desglosan.

Precisión según la dificultad

Dónde se separan los resultados

Fácil

72 casos sencillos

Jev 100%Laya 94.4%

Estándar

96 casos cotidianos

Jev 99%Laya 72.9%

Evaluación

146 solicitudes de tipo evaluativo

Jev 94.5%Laya 69.2%

DifícilDifícil

220 casos realmente ambiguos

Jev 74.1%Laya 34.1%

Las decisiones fáciles y estándar apenas se distinguen. En los casos difíciles es donde los sistemas dejan de coincidir.

El cuarto eje: el coste

The composite also weighs cost, scored from each system’s public list price. Laya is one of the cheapest systems to run, while Jev trades per-call credits for a hosted, ready-to-use model with no idle GPU to operate.

Ver precios de Jev

La clasificación

Todos los sistemas de la clasificación

Arriba se muestran las puntuaciones; aquí están la clasificación y los detalles de despliegue. Jev y Laya aparecen resaltados.

ModeloPuestoPuntuaciónLatencia medidaSe ejecuta en
Jev 1.13.0 (TypeSafe)#174.40,65 s de mediana / 0,72 s p95API de producción alojada
SemIf (Qwen3.5-4B)#273.10,20 s sin ajustar / 0,55 s ajustadoAlojamiento propio, GPU de RunPod
djev (Maisa, DiffusionGemma)#373.00,24 s de mediana / 0,31 s p95API alojada, vista previa gratuita
OpenJev (razorback16)#1166.40,24 s sin ajustar / 0,63 s ajustadoAlojamiento propio, GPU de RunPod
Laya (ModernBERT-large)#3354.40,79 s sin ajustar / 1,72 s ajustadoAlojamiento propio, CPU

El 21 de septiembre de 2026, JevBench v1.3.0 puntuó 52 sistemas con las mismas 534 decisiones (72 fáciles, 96 estándar, 146 de evaluación y 220 difíciles), una solicitud cada vez.

Función por función

Jev y Laya, lado a lado

AtributoJev 1.13.0Laya
Qué esModelo System One alojado de TypeSafe, versión jev-1.13.0Cabeza de decisión de pesos abiertos sobre un codificador ModernBERT/mmBERT congelado
LicenciaPropietario y alojadoApache-2.0; pesos en Hugging Face e instalación desde PyPI
TamañoNo divulgado421 M en inglés o 322 M multilingüe
IdiomasMejor en inglés; menor precisión en otros idiomasCheckpoint en inglés y otro multilingüe con más de 100 idiomas
Calidad sin entrenamiento previo85,7 en inteligencia en JevBench; diseñado para usarse sin entrenamientoLos checkpoints base requieren ajuste fino para tareas de producción
CalibraciónPuntuación de calibración JevBench: 82,7ECE de 0,081 tras ajustar la temperatura en la medición de Convai
Contexto64.000 tokens por solicitud512 tokens por pregunta; los contextos largos pueden truncarse
Opciones por elecciónSin un límite fijo bajoEl rendimiento cae con más de unas 20 opciones; precisión de 0,425 en una tarea con 77 etiquetas
Latencia0,65 s de mediana en la API de producción32,8–39,5 ms en una Tesla T4; 193–464 ms en CPU
Coste de ejecuciónSe factura en créditos de Jev AIAlojamiento propio gratuito; estimación del benchmark: unos 0,0029 USD por 1.000 decisiones

En qué destaca cada uno

El equilibrio práctico

Laya destaca en control, velocidad, cobertura multilingüe y coste de alojamiento propio. Jev sobresale en calidad sin entrenamiento, contexto largo y puesta en marcha inmediata de decisiones fiables.

Ventajas de Jev

  • Funciona sin entrenamiento ni datos etiquetados.
  • Hard-tier accuracy: 74.1% against Laya’s 34.1%.
  • 64.000 tokens de contexto por solicitud para tickets, documentos y trazas extensos.
  • Sin un límite fijo bajo en el número de opciones.

Ventajas de Laya

  • Decenas de milisegundos en una Tesla T4, sin salto de red si se aloja localmente.
  • Más de 100 idiomas con el checkpoint multilingüe.
  • Pesos Apache-2.0 que puedes ajustar y ejecutar sin conexión.
  • Coste marginal muy bajo si ya pagas una GPU que está ocupada.

El análisis

Dos opciones válidas para necesidades distintas

Convai publica buenos datos de latencia y calibración para Laya: 32,8 ms en una Tesla T4 con el checkpoint multilingüe y un error de calibración esperado de 0,081 tras ajustar la temperatura. Es una opción atractiva para flujos estables y de gran volumen.

También importa la limitación: en decisiones tipadas no vistas, los checkpoints base se acercan al azar y quedan por debajo de una referencia de clase mayoritaria. Laya resulta interesante si tienes ejemplos etiquetados, un conjunto de etiquetas estable y capacidad para adaptarlo a tu tarea.

JevBench measured the untuned package on CPU and found 34.1% on hard decisions against Jev’s 74.1%. Long hard-tier states can also be truncated by Laya’s 512-token limit, while Jev accepts 64k tokens per request.

Límite de los datos

Laya permanece en tu red; Jev envía solicitudes a una API alojada.

Modelo operativo

Laya sustituye el gasto de API por la gestión de GPU, serving, supervisión y calibración.

Formato de decisión

Ambos destacan cuando el software necesita una opción tipada, una puntuación o un juicio de sí/no.

Cobertura lingüística

El checkpoint multilingüe de Laya es la opción clara cuando el inglés no basta.

Implementación abierta

Qué es realmente Laya

Laya es una cabeza de decisión sobre un codificador congelado. Puntúa las opciones recibidas en la solicitud, en lugar de generar una frase y después analizar y validar JSON. El checkpoint principal en inglés tiene 421 M de parámetros; el multilingüe, 322 M y más de 100 idiomas.

Está pensado para enrutar tickets, moderar, aplicar protecciones, procesar facturas y observar trazas de agentes: una capa de clasificación alrededor de un stack LLM, no el propio LLM.

Leer Laya en GitHub

Alojado por cuenta propia

Ejecuta los pesos en tu GPU o CPU sin pagar por llamada a la API.

Multilingüe

Enruta más de 100 idiomas mediante el checkpoint mmBERT.

Probabilidades directas

Devuelve probabilidades tipadas sin un ciclo de generación autorregresiva.

Privacidad desde el diseño

Mantén el contexto y los criterios de decisión dentro de tu red cuando sea necesario.

Laya es un proyecto independiente de código abierto y no está afiliado ni respaldado por TypeSafe o Jev AI.

Entonces, ¿cuál deberías usar?

Elige según tus limitaciones

Elige Jev si

  • Aún no tienes datos etiquetados, como le ocurre a casi todos los proyectos al empezar.
  • Las preguntas se definen en cada solicitud y pueden cambiar a medida que entiendes la tarea.
  • Las entradas son largas o una elección contiene más de un par de docenas de opciones.

Elige Laya si

  • Tienes datos etiquetados, un conjunto de etiquetas estable y capacidad para ajustar el modelo localmente.
  • Necesitas cobertura en otros idiomas o requisitos estrictos de residencia de datos.
  • El volumen es alto y la decisión lo bastante acotada como para que compense la inferencia propia.

Una comparación sincera

Prueba Jev con los casos que realmente estáis debatiendo.

La clasificación sirve de orientación. La mejor prueba son tus propios casos difíciles.

Abrir la zona de pruebas de Jev

Preguntas frecuentes

Preguntas frecuentes: Jev y Laya

¿Laya sustituye directamente a Jev?+

No. They answer the same three question types, but Laya’s base checkpoints expect fine-tuning on your task. Jev is designed to work without a training run.

¿Laya es realmente 7,8 veces más rápido que Jev?+

On Convai’s hardware, yes: 32.8ms on a Tesla T4 versus 236–276ms cited for Jev. JevBench measured Laya on CPU, so its comparable raw latency is slower. Hardware and network placement explain most of the gap.

¿Laya admite otros idiomas?+

Sí. El checkpoint mmBERT-base de 322 M cubre más de 100 idiomas, una ventaja clara si el inglés no es tu idioma principal.

¿Cuánto cuesta Laya?+

Los pesos usan Apache-2.0 y se pueden alojar gratis. JevBench estima unos 0,0029 USD de cómputo por cada 1.000 decisiones, aparte del coste de operación y mantenimiento.

¿Laya puede procesar documentos largos?+

No de una vez. Laya limita cada pregunta a 512 tokens y JevBench observó que se truncaban contextos largos en los casos difíciles. Jev admite 64.000 tokens por solicitud.

Laya y los demás productos de esta página pertenecen a sus respectivos propietarios y no están afiliados a Jev AI. Las cifras proceden de las fuentes públicas citadas, consultadas el 22 de septiembre de 2026, y pueden cambiar a medida que evolucionen los modelos y benchmarks.