Recurso del reel de @alexsepu_ · 6 oct 2026
100 Claudes pelean por tu respuesta
La skill gratis del video: la instalas en Claude Code, la lanzas con /arena y te
regresa la única solución que sobrevivió. Aquí van las tres formas de instalarla, cómo usarla sin quemar tokens
y cómo escribir la tarea para que valga la pena.
Todo lo de esta guía lo leí en el repo el 6 de octubre de 2026: el README, el SKILL.md, la
rúbrica y las cartas. Lo que es deducción mía lo digo donde toca.
Paso a paso
Instálala: tres formas, la primera es una línea
Las tres salen de la sección «Install» del README, tal cual. Necesita Claude Code, porque lanza sub-agentes con su herramienta Agent, y Python 3.8 o más nuevo. No hay nada que instalar con pip.
https://github.com/Jakeschincariol/arena-skill Install this skill, then confirm /arena works.
git clone https://github.com/Jakeschincariol/arena-skill.git cp -r arena-skill/skills/arena ~/.claude/skills/
/plugin marketplace add Jakeschincariol/arena-skill /plugin install arena-skill@arena-skill
Para comprobar que quedó, no escribas /arena a secas. Sin tarea, arranca un torneo de 100 agentes
con tu último pedido: 595 llamadas. Haz lo que hace la primera opción y pídele a Claude que confirme que
/arena existe.
Claude Code le pone el nombre del plugin delante a las skills de los plugins, por eso como
plugin se llama /arena-skill:arena. Si quieres el /arena a secas, copia la carpeta (la
opción 2). ¿Sólo para un proyecto y no para todos? Copia esa misma carpeta al .claude/skills/ de tu repo.
Ver la sección «Install» del README original
Cómo se usa
Cuatro formas de lanzarla
La idea es para cuando no te gustó lo que Claude te dio. En vez de pedirlo otra vez y otra
vez, escribes /arena: toma tu último pedido como la tarea y la respuesta que no te gustó como la que
hay que vencer. Los ejemplos del README están en inglés; la tarea es texto libre, así que puedes escribirla en español.
/arena
Sin nada más. Usa tu último pedido como la tarea y tu última respuesta como la que hay que vencer. Son 100 competidores, siete rondas y 595 llamadas a sub-agentes: guárdala para lo que importa.
/arena
/arena --quick
Dieciséis competidores y 91 llamadas. Es el ajuste que el README propone para el día a día.
/arena --quick write the headline for our pricing page
/arena --agents N
Cualquier número de competidores, con la tarea escrita ahí mismo. Con 32 son cinco rondas y 187 llamadas.
/arena --agents 32 fix the flaky test in tests/test_api.py
/arena --seed S
Con la misma semilla salen las mismas cartas y el mismo cuadro de duelos. No las mismas respuestas: el modelo no es determinista. Si no pones semilla, es al azar y queda anotada.
/arena --seed 7 plan my launch week, I have 6 hours a day
| Bandera | Qué hace |
|---|---|
--agents N | N competidores. Por defecto, 100. |
--quick | 16 competidores. El ajuste de diario. |
--seed S | Misma semilla, mismas cartas y mismo cuadro. Por defecto es al azar y se anota. |
--wave W | Sub-agentes por oleada. Por defecto, 10. Sólo súbela si subiste el límite de Claude Code. |
/arena, te pregunta
antes de gastar nada y te ofrece tres caminos: el torneo completo (100 agentes, 595 llamadas), --quick
(16 agentes, 91 llamadas) o un reintento normal. Cuando la escribes tú, te dice en una línea qué tan grande es y arranca.Ver la sección «Use it» del README original
Lo que pasa por dentro
Cien entran, uno sale
Es un torneo de eliminación directa. Cada competidor recibe la misma tarea, palabra por palabra, y una carta distinta que le dice cómo atacarla. Después se emparejan, se atacan, se defienden y un juez decide. El que pierde se va.
Cuando el número es impar, uno pasa libre («bye»), y nunca el mismo agente dos veces mientras haya otro esperando. Salen del
plan que imprime el propio bracket.py para 100 agentes.
Reparto. Cien sub-agentes y una carta cada uno
Todos reciben el mismo texto. Lo que los hace distintos es la carta: un modo de razonar (hay 15), un flujo de trabajo (12) y una estrategia (12). Son 2,160 combinaciones, y el repartidor no repite ninguna.
Primeros principiosInversiónAnalogíaAdversarialRestricción primero Ejemplo resueltoSocráticoContrarioPensamiento sistémicoDescomposición Hacia atrásProbabilísticoDialécticoEvidencia primeroPanel de expertosEsos son los 15 modos de razonar, traducidos. En la skill están en inglés, en
strategies.json, y se pueden editar.Cartaa017Modo de razonar
Inversión
Pregúntate qué haría fallar la respuesta y construye la que vuelve imposible cada falla.
- Flujo
- Primero las pruebas
- Estrategia
- Casos extremos primero
Cartaa042Modo de razonar
Primeros principios
Reduce la tarea a los hechos que nadie discute y reconstruye la respuesta sólo con eso.
- Flujo
- Borrador, crítica y reescritura
- Estrategia
- Lo más simple que funcione
Cartaa088Modo de razonar
Panel de expertos
Responde como lo harían tres expertos distintos y quédate con la idea más fuerte de cada uno.
- Flujo
- Tres borradores, elige uno
- Estrategia
- Claridad ante todo
Tres cartas de ejemplo que armé con las listas reales de
strategies.json, para que veas la forma. En una corrida las reparte la skill.Ataque. Cada uno ataca la solución del otro
Los emparejan evitando que choquen dos agentes con el mismo modo de razonar. Cada lado busca qué está mal, qué requisito se saltó y la entrada exacta que lo rompe. Hasta siete ataques, etiquetados FATAL, MAJOR o MINOR: las etiquetas que salen en el video.
Defensa. Cada uno contesta lo que le tocó
Concede o rebate con pruebas cada ataque que recibió y reescribe su solución para arreglar lo que concedió.
Juez. Otro sub-agente lee las dos y puntúa
Revisa los ataques por su cuenta y puntúa con una rúbrica escrita. Nunca ve las cartas. Un script suma los puntos y pasa el total más alto, y una solución con un fallo FATAL comprobado no le puede ganar a una sin él.
Y otra vez. Los que ganan pasan con su solución ya corregida
Se repite ronda tras ronda: 100, 50, 25, 13, 7, 4, 2 y 1.
Resultado. La que sobrevivió, con sus cicatrices
Te regresa la solución, los ataques que aguantó, su carta y cuántas rondas hicieron falta. Si empezaste desde una respuesta que no te gustó, un último juez la compara con la ganadora a ciegas y te dice la puntuación, aunque gane la vieja.
Con qué puntúa el juez
Cada criterio vale de 0 a 10 y pesa distinto sobre 100. Está escrito en rubric.md:
puedes leerlo y cambiarlo.
«Completo» se mide contra el texto de la tarea, no contra lo que al juez le hubiera gustado. «Específico» pregunta si podrías actuar ahora mismo sin adivinar. «Aguanta» cuenta si cada ataque se arregló o se rebatió bien.
La rúbrica dice lo que no premia: la longitud («una respuesta corta que cumple todo le gana a una larga que cumple lo mismo»), la seguridad con que se defiende («un “ya lo arreglé” no es prueba»), hablar bien de sí misma, ni que coincida con el gusto del juez donde la tarea no lo pide.
Antes de lanzarla
La skill es gratis. Los tokens son tuyos
Cada llamada lee la tarea y una o dos soluciones, así que la cuenta crece con el tamaño de lo que le pidas. El README lo dice sin rodeos: «100 agents is a lot of them».
AgentesLlamadas a sub-agentes por corrida
--quick · la de diarioFuente: sección «What it costs» del README, leída el 6 de octubre de 2026. Si hay una respuesta que
vencer, suma una llamada. El README recomienda --quick o --agents 16 para lo de diario y guardar los 100 para la
respuesta que importa. Antes de arrancar, la skill imprime estos números, y desde la carpeta del repo
python3 skills/arena/bracket.py plan --agents N los saca cuando quieras.
Ver la sección «What it costs» del README original
La guía
Ocho reglas para sacarle el máximo provecho
Salen de lo que el README y el SKILL.md avisan. La primera es la que más cambia el resultado.
Escribe la tarea para un extraño
Los sub-agentes no ven tu conversación. Cada competidor, atacante y juez sólo conoce el archivo de la tarea, y si un requisito no llegó ahí, los 100 lo ignoran. Dile a Claude el público, el largo, el formato, el tono y lo que no puede cambiar, y mira el archivo en .arena/<corrida>/task.md.
Arranca desde una respuesta que no te gustó
Si hay una respuesta que vencer, el último juez la compara a ciegas con la ganadora. Dile qué no te gustó, con tus palabras: esa queja entra a la tarea. Y si la vieja gana, te lo dice.
Empieza chico
--quick para lo de todos los días. Los 100 sólo para la respuesta que importa: son 595 llamadas contra 91.
Activa «aceptar ediciones» antes
Cada sub-agente escribe un archivo en .arena/. En el modo normal de permisos eso es una aprobación por archivo, cientos en una corrida grande. La skill te sugiere pulsar Shift+Tab; no cambia tus ajustes por ti.
Lee los ataques que sobrevivió
No sólo la respuesta. Ahí está por qué ganó y por dónde todavía puede romperse. El README es claro: te da la mejor respuesta que encontró el torneo, «not a proof that it is right».
No arregla una mala tarea
Una tarea vaga produce 100 versiones de lo vago. Si la tarea no dice qué es «listo», ningún juez lo va a inventar por ti.
No toca tus archivos
Todo se escribe dentro de .arena/. Si la solución cambia código, llega como un diff o como archivos completos dentro de la respuesta, y la skill te pregunta si lo aplica o lo cambias.
La semilla compara cartas, no respuestas
Misma semilla, mismas cartas y mismo cuadro; respuestas distintas, porque el modelo no es determinista. Mi uso: si sólo cambias la redacción de la tarea y quieres comparar parejo, repite la semilla.
Para pegar
Tres tareas bien escritas
La skill le pide a Claude que la tarea incluya cinco cosas: tu pedido, cada requisito que dijiste, el contexto que necesitaría un extraño, cómo se ve «listo» y qué no te gustó de la respuesta anterior. Estas tres siguen ese molde. Son mías, no del repo: cambia lo que va entre corchetes.
/arena --quick Escríbeme el titular de la página de inicio de [tu producto]. Para quién es: [tu cliente, en una línea]. Qué problema le resuelve, en sus palabras: [lo que él diría, no tú]. Qué lo distingue de [lo que usan hoy]: [una sola cosa concreta]. Reglas: máximo 10 palabras, sin adjetivos vacíos como "innovador" o "líder", y que diga el resultado que obtiene. Lo que no me sirvió de la respuesta anterior: [por qué no te gustó].
/arena Arma mi semana de lanzamiento de [qué lanzas]. Tengo [6] horas al día, de lunes a viernes. Tiene que estar listo el viernes: [las 3 cosas sin las que no se lanza]. Ya está hecho: [lista]. No puede cambiar: [la fecha, el presupuesto, lo que ya prometí]. Entrégalo como una tabla día por día, con lo primero que hago cada día y cuánto me toma. Si algo no cabe en mis horas, dime qué se queda fuera en vez de apretarlo.
/arena --agents 32 El test [nombre] en [ruta] falla de forma intermitente: 1 de cada [10] corridas. Lo que ya probé y no funcionó: [lista]. Lo que no se puede tocar: [archivos o comportamiento]. Lo que quiero: la causa raíz y el arreglo como diff, no una lista de sospechas. Si el arreglo cambia más de [20] líneas, explícame por qué hacía falta.
Los tres arrancan con el tamaño elegido a propósito: el titular es una tarea de diario (--quick), el
plan va con los 100 porque lo vas a ejecutar toda la semana, y el bug con 32 porque tiene una respuesta que se puede comprobar. Escribe todo en la
misma petición: lo que sólo dijiste antes en la conversación, los sub-agentes no lo ven.
Si algo falla
Los atorones, con su salida
No te voy a inventar errores que no vi. Son los que el README y el SKILL.md traen escritos.
| Lo que pasa | Qué hacer |
|---|---|
| Te pide aprobar un archivo tras otro | Es el modo normal de permisos: un permiso por archivo. Activa «aceptar ediciones» con Shift+Tab antes de lanzar la corrida. |
| Tarda mucho | Es de esperarse: Claude Code corre como máximo 10 llamadas a la vez (el ajuste CLAUDE_CODE_MAX_TOOL_USE_CONCURRENCY), así que 100 agentes son 70 oleadas. Para lo de diario usa --quick. |
La instalaste como plugin y /arena no existe | Como plugin se llama /arena-skill:arena. Si quieres el nombre corto, copia la carpeta a ~/.claude/skills/. |
| La respuesta ganadora no tomó en cuenta algo que pediste | Abre .arena/<corrida>/task.md. Si ese requisito no está ahí, ninguno de los 100 lo vio: los sub-agentes no leen tu conversación. |
| Se compactó la conversación a la mitad de la corrida | No se pierde nada: el torneo vive en un archivo JSON dentro de .arena/ y la skill lo retoma desde ahí. |
| Quieres parar | Dile que pare. El estado queda guardado y se puede reanudar después. |
| Te da miedo que toque tu proyecto | No lo toca: los sub-agentes sólo escriben dentro de .arena/. Si uno escribiera en otro lado, la skill tiene la instrucción de avisarte. |
La letra chica
Qué es y qué no es
«100 versiones de Claude» son 100 sub-agentes del mismo modelo
Del que estés usando, no 100 modelos distintos. Lo que los diferencia es la carta. El repartidor garantiza que no haya dos con la misma carta y que, hasta 144 agentes, ni siquiera compartan dos de sus tres partes.
«La mejor» es la que sobrevivió todos los duelos
Los jueces también son Claude, puntuando con una rúbrica escrita que puedes leer y cambiar. Lo que recibes es la respuesta más fuerte que encontró este torneo, no una prueba de que sea correcta. Por eso te enseña los ataques que aguantó.
Un competidor es su carta más su archivo de solución
Los sub-agentes no recuerdan nada entre llamadas: cuando el competidor a017 ataca en la ronda 3, es un sub-agente nuevo al que le dan su carta y su última solución. Por eso son 595 llamadas para 100 competidores.
Fuentes y método
De dónde sale cada dato
Todo lo consulté el 6 de octubre de 2026. La skill es de otra persona y puede cambiar: si algo no coincide con lo que ves en el repo, manda el repo.
- Jake Schincariol: el repo de la skill: README (instalación, uso, costos, letra chica), licencia MIT. · 6 oct 2026github.com/Jakeschincariol/arena-skill
- Jake Schincariol: SKILL.md: los pasos que sigue Claude, cuándo pregunta antes de gastar y el contenido de la tarea. · 6 oct 2026skills/arena/SKILL.md
- Jake Schincariol: rubric.md: los cinco criterios, sus pesos y lo que el juez no premia. · 6 oct 2026skills/arena/rubric.md
- Jake Schincariol: strategies.json: los 15 modos de razonar, los 12 flujos y las 12 estrategias. · 6 oct 2026skills/arena/strategies.json
Cómo se hizo esta guía. Las capturas son de la página oficial de GitHub, tomadas sin sesión el 6 de octubre de 2026 y recortadas a la sección, sin retoque. No corrí un torneo de 100 agentes para escribir esto: lo que cuenta cada paso sale de leer el README, el SKILL.md y la rúbrica. Lo que es deducción o uso mío lo digo así. Son mías las tres tareas para pegar y las tres cartas de ejemplo, que armé con las listas de strategies.json. Sotai no está afiliada a Jake Schincariol ni a Anthropic.
Si no te gusta la respuesta, no vuelvas a preguntar. Que peleen
Empieza con /arena --quick en algo de diario, mira qué ataques sobrevivió la ganadora y, cuando
tengas una respuesta que de verdad importe, lánzala con los cien.
Alex Sepúlveda · 6 de octubre de 2026
Sigue aprendiendo
Más guías de agentes y Claude
Claude Code · 1 oct 2026Claude + GPT en 3 líneas: la guía del plugin oficial y los prompts
Voz · Live API · 21 sep 2026Monta tu agente de voz: la IA que contesta el teléfono de tu negocio
Claude Code · 16 sep 202620 comandos de Claude Code que ya tienes¿Lo quieres funcionando en tu negocio sin armarlo tú?
Escríbenos