Cómo se emite un veredicto, y qué lo puede dar vuelta.
Todo lo que hay aquí está diseñado para que no tengas que confiar en nosotros: criterios registrados antes de correr, datos sellados y anclados por hash, resultados que puedes recomputar tú mismo.
El veredicto no es binario: son cinco capas
El binario —¿ganó o no?— lo regala la literatura gratis. Se cobra por las capas 2 a 5.
¿Los artefactos del claim corren? runnable / partially / not runnable. Muchos claims mueren aquí.
Bajo un criterio pre-registrado y sellado ANTES de correr. Nunca se ajusta mirando el resultado.
Brecha porcentual contra el baseline campeón, razón de tiempo a solución, número de semillas e intervalo — o su ausencia declarada. Si la varianza no se midió, se dice que no se midió.
Sensibilidad a tamaño, semillas e hiperparámetros, y fuerza del baseline: ¿gana sólo contra rivales débiles?
Dos o tres eventos observables que darían vuelta el veredicto. Es lo que hace que el informe envejezca bien.
El resultado en las unidades del cliente. Los números del cliente los pone el cliente o se marcan como supuesto; nosotros ponemos la aritmética y las fuentes.
La escala de evidencia (EL0–EL5)
Adaptada de GRADE, el estándar de revisión de evidencia en medicina: un nivel base dado por el diseño de la evidencia, más factores declarados que suben o bajan la confianza — nunca aritmética oculta, siempre el motivo por escrito.
| nivel | nombre | qué exige |
|---|---|---|
| EL0 | Sólo claim | Afirmación pública con fecha y fuente. Sin datos crudos ni código descargables por hash. |
| EL1 | Artefactos de primera parte | Datos crudos y código publicados y verificables por hash: cualquiera puede recomputar lo que el autor hizo. |
| EL2 | Pre-registrado y sellado | Criterio registrado ANTES de correr, corrida sellada, el resultado cumple su propio criterio, y baseline clásico declarado en la misma cancha. Todavía primera parte. |
| EL3 | Reproducido independientemente | Un tercero sin participación ni pago del autor reprodujo el resultado principal desde los artefactos publicados. Hoy: vacío. Nadie en el registro lo tiene. |
| EL4 | Probado adversarialmente | EL3 más haber sobrevivido un intento serio y publicado de refutación, o haber sido reproducido contra el baseline clásico más fuerte conocido, a paridad. |
| EL5 | Verificado en producción | Verificación independiente en un despliegue real con consecuencia económica y árbitro externo nombrado. Hoy, uno: certified randomness. |
La escala mide la fuerza de la evidencia de que la ventaja es real. NO mide la supervivencia en el tiempo: eso es el estado (surviving / contested / eroded / open / negative-selfpublished), que es ortogonal y se muestra al lado. Un claim puede ser EL2 y estar eroded; otro EL0 y en pie.
La rúbrica v1.0 está lista para sellar y todavía NO está sellada. Hasta que lo esté, no publicamos el nivel de ningún claim: puntuar con una vara que aún se puede cambiar es exactamente lo que esta casa existe para no hacer.
juez-v1: paridad de presupuesto
El protocolo que hace comparable una comparación. El lado clásico y el cuántico reciben la misma instancia, el mismo presupuesto de cómputo y el mismo tiempo, con semillas fijas y versiones declaradas. El baseline es el campeón de la clase, afinado — no el primero que compila. Sin paridad declarada, un resultado no es evidencia: es una demo.
La Two-Layer Rule
Capa A — la infraestructura de sellado: mecánica, sin opinión. La puede pagar cualquiera, incluidos los vendors. Notariza integridad y fecha, no verdad. Capa B — el juicio: veredictos, niveles de evidencia, informes, Monitor, Registry, Library. La paga sólo el lado de la demanda; el evaluado jamás, ni directa ni indirectamente.
Verifica un sello tú mismo → · El registro completo →
Versión 1.0 · 1 sep 2026. Los cambios de metodología se publican fechados; los veredictos citan la versión bajo la que se emitieron.