COMPARATIVA DE JEV · JEVBENCH V1.3.0 · ACTUALIZADO EL 22 DE SEPTIEMBRE DE 2026

Jev frente a SemIf

La reconstrucción abierta más sólida de la tabla y aquello en lo que aún se queda atrás.

En este sitio

Jev 1.13.0

TypeSafe · modelo System One

74.4

No tienes que ejecutar nada y aun así destaca cuando los casos se complican.

JevBench v1.3.0 · puesto n.º 1
vs.

Alternativa

SemIf

TheoLeeCJ · lector abierto de logits basado en Qwen3.5-4B

73.1

Se queda a solo 1,3 puntos de Jev en una tarjeta gráfica que ya tienes.

JevBench v1.3.0 · puesto n.º 2
API alojada: no tienes que operar infraestructura
DÓNDE SE EJECUTA
Alojado en una GPU propia o alquilada
Propietario y alojado
LICENCIA
Código MIT sobre pesos abiertos
94,5% de aciertos
CASOS DE TIPO EVALUATIVO
95,2% de aciertos
74,1% de aciertos
CASOS DE PRUEBA MÁS DIFÍCILES
59,5% de aciertos
Calibrado de serie: 82,7 / 100
PROBABILIDADES
Requiere calibración para tu carga: 72,6 / 100
Sent to TypeSafe's API
DÓNDE VAN TUS DATOS
No sale de tu red

El benchmark

JevBench v1.3.0, medido en las mismas condiciones

Un único benchmark evaluó los 52 sistemas con el mismo método, por lo que estas barras sí son comparables entre sí, a diferencia de las cifras publicadas por cada proveedor.

Puntuación compuesta

Más alto es mejor

JevBench v1.3.0

#1 Jev
74.4
#2 SemIf
73.1
#3 djev
73.0
#11 OpenJev
66.4
#33 Laya
54.4

Los tres primeros quedan a menos de 1,4 puntos entre sí y después la clasificación cae con fuerza. La puntuación compuesta oculta las diferencias reales, por eso los dos gráficos siguientes la desglosan.

Precisión según la dificultad

Dónde se separan los resultados

Fácil

72 casos sencillos

Jev 100%SemIf 100%

Estándar

96 casos cotidianos

Jev 99%SemIf 97.9%

Evaluación

146 solicitudes de tipo evaluativo

Jev 94.5%SemIf 95.2%

DifícilDifícil

220 casos realmente ambiguos

Jev 74.1%SemIf 59.5%

Las decisiones fáciles y estándar apenas se distinguen. En los casos difíciles es donde los sistemas dejan de coincidir.

El cuarto eje: el coste

The composite also weighs cost, scored from each system's public list price. Jev places last on that axis, but the benchmark does not turn a single price into a recommendation: bursty traffic and idle GPU time change the economics of self-hosting.

Ver precios de Jev

La clasificación

Todos los sistemas de la clasificación

Arriba se muestran las puntuaciones; aquí están la clasificación y los detalles de despliegue. Jev y SemIf aparecen resaltados.

ModeloPuestoPuntuaciónLatencia medidaSe ejecuta en
Jev 1.13.0 (TypeSafe)#174.40,65 s de mediana / 0,72 s p95API de producción alojada
SemIf (Qwen3.5-4B)#273.10,20 s sin ajustar / 0,55 s ajustadoAlojamiento propio, GPU de RunPod
djev (Maisa, DiffusionGemma)#373.00,24 s de mediana / 0,31 s p95API alojada, vista previa gratuita
OpenJev (razorback16)#1166.40,24 s sin ajustar / 0,63 s ajustadoAlojamiento propio, GPU de RunPod
Laya (ModernBERT-large)#3354.40,79 s sin ajustar / 1,72 s ajustadoAlojamiento propio, CPU

El 21 de septiembre de 2026, JevBench v1.3.0 puntuó 52 sistemas con las mismas 534 decisiones (72 fáciles, 96 estándar, 146 de evaluación y 220 difíciles), una solicitud cada vez.

Función por función

Jev y SemIf, lado a lado

AtributoJev 1.13.0SemIf
Qué esModelo System One alojado de TypeSafe, versión jev-1.13.0Lector de logits autoalojado sobre modelos abiertos congelados
LicenciaPropietario y alojadoCódigo del proyecto bajo MIT; los pesos mantienen sus licencias de origen
Modelo baseNo divulgado; posentrenado con RLCDPrincipalmente Qwen3.5-4B; también Qwen3-0.6B, MiniCPM5-2B y Qwen3-Reranker-4B
HardwareNinguno: es una llamada a la APITu propia GPU; las cifras publicadas se midieron en una RTX 3090
CalibraciónPosentrenado para ofrecer probabilidades calibradas; JevBench: 82,7Depende de las opciones proporcionadas; requiere calibración por carga de trabajo. JevBench: 72,6
Precisión en el nivel de evaluación94.5%95,2%: SemIf gana en este apartado
Precisión en casos difíciles74.1%59.5%
Coste de ejecuciónSe factura en créditos de Jev AI, sin coste por inactividadUnos 0,022 USD por 1.000 decisiones con una GPU alquilada ocupada; también se cobra el tiempo inactivo

En qué destaca cada uno

El equilibrio práctico

En conjunto, SemIf está muy cerca. La diferencia importante no es tanto la clasificación como quién controla la infraestructura, los datos y el trabajo de calibración.

Ventajas de Jev

  • Precisión en casos difíciles: 74,1% frente a 59,5%.
  • Mejor calibración inicial: 82,7 frente a 72,6.
  • No tienes que operar una GPU, infraestructura de serving, planificación de capacidad ni costes de inactividad.
  • 64.000 tokens de contexto por solicitud y límites de producción publicados.

Ventajas de SemIf

  • Judge-tier accuracy: 95.2% against Jev's 94.5%.
  • Código MIT que puedes leer, bifurcar, auditar y ejecutar con pesos controlados.
  • Sin coste por llamada una vez pagada una GPU que ya está ocupada.
  • Funciona sin conexión e incluye una demo para navegador con WebGPU.

El análisis

La diferencia se concentra en unos aspectos, no en todos

Give SemIf its due: 73.1 against Jev's 74.4 in JevBench v1.3.0, second on the board, and ahead on the 146-decision judge tier.

La diferencia se concentra en dos aspectos. En 220 decisiones difíciles, Jev obtiene un 74,1% y SemIf un 59,5%, una brecha de 14,6 puntos. En calibración, Jev alcanza 82,7 frente a 72,6 porque sus probabilidades se entrenan para la interfaz de decisión, en lugar de leerse directamente de un modelo congelado.

The third gap is operational. SemIf's low per-decision estimate assumes a rented GPU that stays busy. Idle GPUs bill the same as busy ones, so bursty traffic moves that number in a hurry.

Límite de los datos

SemIf permanece en tu red; Jev envía solicitudes a una API alojada.

Modelo operativo

SemIf sustituye el gasto de API por la gestión de GPU, serving, supervisión y calibración.

Formato de decisión

Ambos destacan cuando el software necesita una opción tipada, una puntuación o un juicio de sí/no.

Implementación abierta

Qué es realmente SemIf

SemIf recibe contexto no estructurado, criterios definidos en la solicitud y opciones tipadas. Ejecuta una pasada hacia delante por un modelo abierto y lee los logits nativos de esas opciones, en vez de generar una frase, analizar JSON y validarlo después.

La configuración principal del benchmark usa Qwen3.5-4B. El proyecto también admite Qwen3-0.6B, MiniCPM5-2B y Qwen3-Reranker-4B. El código es MIT; los pesos conservan sus licencias originales.

Leer SemIf en GitHub

Alojado por cuenta propia

Ejecuta el modelo en tu GPU o alquila una cuando el volumen lo justifique.

Demo en navegador

Prueba una versión WebGPU en el navegador sin lista de espera.

Logits directos

Devuelve probabilidades tipadas sin un ciclo de generación autorregresiva.

Privacidad desde el diseño

Mantén el contexto y los criterios de decisión dentro de tu red.

SemIf se llamaba antes OpenJev. Es un proyecto independiente y no está afiliado ni respaldado por TypeSafe o Jev AI.

Entonces, ¿cuál deberías usar?

Elige según tus limitaciones

Elige Jev si

  • El tráfico es irregular o no quieres operar infraestructura de serving con GPU.
  • Las entradas incluyen casos largos, ruidosos o controvertidos en los que importa el nivel difícil.
  • Quieres umbrales funcionales desde el primer día, sin tener que calibrarlos antes.

Elige SemIf si

  • Ya tienes capacidad GPU inactiva o puedes mantener ocupada una alquilada.
  • Por ley, los datos no pueden salir de tu red.
  • La mayoría de las decisiones son fáciles, estándar o de evaluación y puedes calibrarlas localmente.

Una comparación sincera

Prueba Jev con los casos que realmente estáis debatiendo.

La clasificación sirve de orientación. La mejor prueba son tus propios casos difíciles.

Abrir la zona de pruebas de Jev

Preguntas frecuentes

Preguntas frecuentes: Jev y SemIf

¿SemIf es lo mismo que OpenJev?+

SemIf es el nombre actual del proyecto de TheoLeeCJ antes llamado OpenJev. Hay otros proyectos sin relación que también usan el nombre openJev.

¿SemIf es tan preciso como Jev?+

Está cerca en la mayoría de niveles y gana en uno. En JevBench v1.3.0 iguala a Jev en decisiones fáciles, queda algo por detrás en las estándar, gana la evaluación por 95,2% a 94,5% y pierde en las difíciles por 59,5% a 74,1%.

¿Qué hardware necesito para ejecutar SemIf?+

Las cifras publicadas usan un modelo 4B en una RTX 3090. Los modelos compatibles más pequeños requieren menos recursos y hay una demo WebGPU para navegador, pero el rendimiento de producción presupone una GPU.

¿SemIf ofrece probabilidades calibradas?+

Devuelve probabilidades condicionadas a las opciones proporcionadas. El proyecto incluye calibración por temperatura y su README recomienda ajustar y validar las probabilidades en la carga de trabajo real.

¿Cuánto cuesta ejecutar SemIf?+

JevBench estima unos 0,022 USD por 1.000 decisiones con una GPU siempre ocupada. No incluye el tiempo de inactividad ni el coste de ingeniería de operar la infraestructura.

Las cifras proceden de las fuentes públicas anteriores, consultadas el 22 de septiembre de 2026. SemIf y los demás productos mencionados pertenecen a sus respectivos propietarios.