Install any skill in seconds. Free to start, no credit card required.
Get Started Free →Design statistically rigorous A/B tests for product features, UI changes, onboarding flows, and pricing experiments. Use when asked to set up an experiment, design an A/B test, calculate sample size, or interpret test results. Produces a complete test plan with hypothesis, variant definitions, sample size, duration estimate, guardrail metrics, and a results interpretation guide.
| Test case | Without → With | Effect | Δ tokens | Δ turns |
|---|---|---|---|---|
| case-07 | ✗→✓ | ▲ Improved | 73% | 0% |
| case-10 | ✗→✓ | ▲ Improved | 20% | 0% |
| case-13 | ✗→✓ | ▲ Improved | 93% | 0% |
| case-16 | ✗→✓ | ▲ Improved | 60% | 0% |
| case-17 | ✗→✓ | ▲ Improved | 20% | 0% |
Diseña experimentos que producen resultados confiables — no solo señales direccionales. Cada output del test incluye hipótesis, métricas de éxito, tamaño de muestra, duración y una guía de interpretación de resultados.
Pregunta al usuario por estos datos si no están proporcionados:
Antes de ejecutar cualquier test, confirma:
> "Creemos que cambio] causará que métrica primaria] se incremente/disminuya] en un X%] para segmento de usuarios], porque razonamiento basado en datos o insight]."
Nunca ejecutes un test sin una hipótesis direccional. "Veamos qué pasa" no es una hipótesis.
Usa esta fórmula (proporciona el output, no la fórmula, al usuario):
Para escenarios comunes, proporciona estimaciones pre-calculadas:
| Baseline Rate | MDE (Relativo) | Muestra Requerida por Variante | |---|---|---| | 5% | 20% | ~19,000 | | 10% | 15% | ~14,000 | | 20% | 10% | ~15,000 | | 40% | 10% | ~9,500 | | 60% | 5% | ~42,000 |
Siempre advierte: "Estas son estimaciones. Usa una herramienta como el calculador de Evan Miller o Statsig para precisión."
Mínimo: 2 semanas completas (para capturar estacionalidad semanal) Máximo: 4 semanas (el efecto novedad distorsiona resultados más allá de esto)
Duración = Muestra requerida ÷ (Tráfico diario × % expuesto)
Alerta si el tráfico es muy bajo para llegar a significancia en menos de 8 semanas — recomienda un enfoque diferente (ej., holdout test, investigación cualitativa).
Hipótesis: > Plantilla de hipótesis completada]
Variantes:
Métrica Primaria: Nombre de métrica + cómo se mide] Métricas Guardrail: Métricas que no deben degradarse]
Segmento Objetivo: Quién ve el test — % de tráfico, tipo de usuario] Split de Tráfico: 50/50 recomendado a menos que se necesite ramp-up]
Tamaño de Muestra Requerido: ~N] usuarios por variante Duración Estimada: X] semanas (basado en Y] usuarios elegibles diarios) Umbral de Significancia: 95% de confianza, 80% de power
Exclusiones: Segmentos de usuarios a excluir y por qué]
Trigger de Rollback: Si métrica guardrail] se degrada en X%], detén el test inmediatamente.
Guía de Interpretación de Resultados:
Other measured skills in the registry, with their headline benchmark lift.