IA y agentes · Ingeniería agéntica · 7 min
Dark factories: qué revela un experimento sobre agentes y arquitectura
Automatizar la escritura y las pruebas no automatiza por sí solo el criterio arquitectónico. Un caso reportado por HumanLayer ayuda a entender dónde conviene mantener revisión humana.
La promesa de apagar las luces
La idea de una “dark factory” es delegar a agentes el ciclo completo de una tarea de software —desde el ticket hasta la integración o el despliegue— con mínima lectura humana del código. El atractivo es claro: ampliar capacidad y acortar ciclos. El riesgo aparece cuando el volumen de cambios crece más rápido que la capacidad del equipo para entenderlos.
En una presentación de 2026, Dex Horthy describió una prueba interna de automatización “lights-off” que su equipo había iniciado en 2025 y decidió detener tras encontrar un problema difícil de diagnosticar. La historia es una experiencia reportada por un equipo, no una prueba de que todos los sistemas autónomos se degraden en tres meses ni un benchmark comparativo.
Una prueba verde responde una pregunta limitada
Una suite puede confirmar que ciertos casos de comportamiento siguen funcionando. No demuestra automáticamente que el diseño sea fácil de extender, que los límites entre componentes sean adecuados o que la siguiente modificación vaya a ser barata. El resultado depende de qué comprueban los tests y de la calidad de sus oráculos.
Por eso, “pasó CI” y “la arquitectura conserva sus propiedades” son afirmaciones diferentes. Para acercar ambas, hacen falta revisiones de diseño, reglas estáticas, contratos, pruebas de integración y una revisión humana proporcional al impacto del cambio.
Tres maneras de combinar agentes y supervisión
El material de origen contrasta tres modelos operativos. Una fábrica “lights-off” elimina la lectura humana; una fábrica de revisión lenta deja que el agente produzca cambios grandes para inspeccionarlos al final; una fábrica de leverage points invierte criterio humano antes de implementar y mantiene las entregas acotadas. Son categorías explicativas, no una taxonomía normativa ni una medición universal de productividad.
La tercera opción busca reducir incertidumbre antes de delegar: acordar propósito, restricciones, arquitectura y una primera rebanada verificable. Así, el agente acelera ejecución dentro de un marco que el equipo todavía puede comprender y corregir.
Automatizar sin perder propiedad del sistema
Una práctica sostenible asigna autonomía por riesgo. Conviene empezar por tareas pequeñas, reversibles y medibles; hacer que el agente abra cambios revisables en vez de desplegar sin barreras; evaluar no solo la salida, sino también diffs, dependencias, pruebas y señales operativas.
La pregunta útil no es cuántas líneas puede generar un agente, sino si el equipo puede explicar, mantener y revertir lo que produjo. La supervisión temprana protege ese conocimiento compartido.
Fuentes y rigor
Referencias
- Dex Horthy: Harness Engineering Is Not Enough — Why Software Factories Fail, AI Engineer, 23-07-2026
Presentación citada por Dark Factory Dev. Las afirmaciones sobre su experimento se atribuyen a Horthy.
- BigGo: Dex Horthy y el experimento de la Dark Factory, 15-07-2026
Resumen editorial de una entrevista; el caso sirve como experiencia reportada, no como estudio controlado ni como medición de toda la industria.
- Dex Horthy / HumanLayer: 12 Factor Agents, 03-04-2025
Conclusión
Los agentes pueden aumentar la capacidad de ejecución; mantener arquitectura y propiedad intelectual del sistema sigue requiriendo señales adecuadas, cambios comprensibles y responsabilidad humana.
Sigue explorando