Benchmark Público & Números Honestos
Exposición técnica transparente y reproducible del rendimiento de compresión y ahorro de tokens.
Medición del 26 de julio de 2026 · binario v0.5.1 · n=10 por modo en frío, n=20 con caché · fuente de verdad: measure_modes.py
Compromiso de Honestidad Radical
A diferencia de otros benchmarks del mercado, que sólo publican su mejor caso, este informe reporta la distribución real completa sobre corpus sucios (favorables) y corpus limpios (realistas), incluyendo peticiones frías y calientes (caché) — y en particular los 5 escenarios donde no ahorramos nada: 0.0% exacto, a propósito, porque el gate prefiere no tocar el prompt antes que arriesgar.
10/10 peticiones repetidas ahorran el 100% de tokens. Respuesta instantánea sin llamar a la API externa (4 niveles de caché cifrados con AES-256).
En modo económico y primera petición sobre corpus favorables (HTML sucio 65.3%, logs 65.9%, e historial redundante hasta 80.8% de ahorro de tokens).
0.0% de inflación en corpus limpios en modo conservador. El Quality-Gate G1 revierte automáticamente cualquier prompt que pretenda crecer.
Comparativa con la Competencia
Comparativa técnica frente a alternativas de compresión del mercado.
| Métrica / Característica | Competidor A | Competidor B | DWAI v0.5.1 |
|---|---|---|---|
| Caché Local Multicapa | No disponible | No disponible | 100% Hits (4 Niveles + AES-256) |
| Compresión Input Favorable | ~31% | N/A (no comprime input) | 0.7% – 80.8% (media 50.5%, frío) |
| Compresión Input Realista | (no publica corpus limpio) | N/A | 0.0% (corpus realista, frío) |
| Compresión Output | ~74% (cifra sin auditar) | ~65% (cifra sin auditar) | Directivas telegráficas (sin publicar hasta medir usage) |
| Gobernanza Runtime | Quality-gate fijo | N/A (skill) | Auto-gobierno Wilson + UCB-1 + Quality-Gate G1 |
| Seguridad & Privacidad | Requiere CA MITM raíz | N/A | Binario Go nativo, CGO-free, PII masking local |
Resultados Detallados por Modo
Medición realizada sobre 10 escenarios mixtos y 2 repeticiones por escenario con el motor G1.
1. Modo Conservador
Cero Inflación- Peticiones repetidas (Caché): 10/10 hits (100%)
- Corpus favorable (frío): Media 9.4% (máx 40.0%)
- Corpus limpio / realista (frío): 0.0% (Sin degradación)
- Media global fría + caliente: 52.4% Ahorro
Los placeholders compactos y reutilizados mantienen el enmascaramiento de las 40 IPs sin aumentar el prompt: 522 → 522 tokens. La privacidad permanece activa; el coste artificial del placeholder fue eliminado.
2. Modo Económico / Ahorro
Máxima Compresión- Peticiones repetidas (Caché): 10/10 hits (100%)
- Corpus favorable (frío): Media 50.5% (hasta 80.8%)
- Corpus limpio / realista (frío): Media 0.0% (min 0.0%)
- Media global fría + caliente: 62.6% Ahorro
En los escenarios fríos evaluados del modo económico no aumentó el prompt: el caso de código largo quedó en +0.7% de ahorro. Las repeticiones posteriores fueron 10/10 hits de caché.
Límites Declarados de la Medición
No publicamos porcentajes de ahorro en respuestas hasta medir contra el usage oficial reportado por OpenAI/Anthropic en API.
Los descuentos del proveedor por prompt caching se aplican adicionalmente a los ahorros locales de DWAI.
El proxy aplica cuarentena estadística automática por optimizador mediante presupuesto de error de intervalo de Wilson.
Nota metodológica: estas cifras son mediciones de escenarios y corpus concretos. Las capacidades de producto como MCP, enrutamiento y fallback se describen en la documentación y no forman parte de esta tabla de resultados.
Inicio Rápido
Configura el proxy en menos de 2 minutos y empieza a ahorrar.
Binario nativo para Windows, macOS y Linux. Sin dependencias ni instalador.
Ir a descargas →Una sola línea en tu código. Sin más cambios.
api_base = "http://localhost:8080/v1"
Caché multicapa, compresión y gobernanza automática en cada petición.