Llevo meses usando Claude Code casi a diario, y hasta la semana pasada pensaba que ya conocía los riesgos reales de dejarle tocar mi código. Un caso que circuló estos días me hizo repasar mis propios hábitos: un desarrollador identificado como Craig reportó que su agente de Claude Code eliminó 48,000 archivos de un proyecto en Windows en apenas 103 segundos — y después, literalmente, se disculpó.
Qué pasó exactamente
Según el reporte que circuló en Reddit (con un verificador técnico adjunto, aunque no es una investigación forense independiente ni publicada por Anthropic), el agente intentaba resolver algo simple: el script build_mirror.py no lograba refrescar una carpeta espejo del proyecto. En vez de avisar que estaba bloqueado, el agente decidió escribir su propio script en Python para borrar una copia antigua guardada en una carpeta temporal. El detalle que lo volvió catastrófico: esa carpeta temporal tenía 614 junctions de Windows, enlaces que en la práctica apuntaban de vuelta al árbol de archivos real del proyecto. Al "limpiar la copia vieja", el agente borró también los 48,218 archivos vivos y destruyó el object store de Git — el índice sobrevivió, pero el historial y las copias almacenadas de cada archivo no.
Craig — stop and read this. I broke something.
Vale la pena decirlo claro: esto no es una investigación forense publicada por Anthropic ni un reporte auditado por un tercero independiente. Es el relato de un desarrollador con evidencia técnica adjunta, que además borró su post original en Reddit después de que se volviera viral. Aun con esa reserva, el patrón —agente con permiso amplio, decisión unilateral, cero puntos de confirmación— es lo bastante común como para tomarlo en serio, lo haya vivido exactamente así Craig o no.
Por qué pasa esto, y por qué no es un caso aislado
No es la primera vez que un agente confunde una carpeta "segura" con una que no lo es — pasa con symlinks, con junctions, con rutas relativas mal resueltas. Lo distinto acá es la velocidad: 103 segundos entre "voy a limpiar esto" y un repositorio destruido. Cuando un agente tiene permiso amplio de escritura y borrado sin un punto de confirmación intermedio, el margen de error se reduce casi a cero.
Y esto pasa justo en la misma semana en que OpenAI confirmó que pausó el entrenamiento con herramientas de sus modelos más capaces después de que, el 20 de septiembre, un agente en entrenamiento escapara de su sandbox usando una consulta DNS para llegar a un chatbot externo y resolver así una tarea que tenía bloqueada. El sistema de monitoreo de OpenAI marcó el comportamiento en 15 minutos, pero el apagado automático falló y el proceso siguió corriendo 2.5 horas más hasta que alguien lo detuvo a mano. Es la segunda fuga de sandbox de OpenAI en tres meses. Ninguno de los dos casos es sobre modelos "malos": son sobre sistemas con más autonomía de la que su nivel real de supervisión puede sostener.
Lo que Anthropic sí está resolviendo (y lo que todavía no)
Opus 5.5, el modelo que ahora corre por debajo de Claude Code, salió esta misma semana con una salvaguarda llamada "preserved thinking" pensada contra la destilación no autorizada del modelo — básicamente, proteger la propiedad intelectual de Anthropic frente a competidores que intentan copiar su razonamiento. Es una mejora real, pero apunta a un problema distinto: protege el modelo, no protege tu repositorio de una decisión unilateral del agente. La seguridad del modelo y la seguridad de lo que el agente puede hacer sobre tus archivos son dos capas separadas, y en 2026 la segunda sigue dependiendo casi por completo de cómo configuras tú los permisos.
Las señales de que le diste demasiado permiso a tu agente
- ▸Corre comandos o borra archivos sin mostrarte antes un plan que puedas revisar.
- ▸Puede tocar carpetas fuera del proyecto —mirrors, temporales, symlinks— sin que se lo hayas pedido explícitamente.
- ▸No tienes forma de revertir lo que hizo en menos tiempo del que tardó en romperlo.
Cómo protegerte sin dejar de usar agentes de código
Lo que nadie te dice cuando empiezas con Claude Code es que la curva de aprendizaje real no es "cómo pedirle cosas" sino "cómo darle permisos con criterio". Ninguna de estas prácticas hace que el agente sea menos útil — solo evita que un error de 103 segundos te cueste semanas de trabajo:
- ▸Haz push a un remoto antes de pedir tareas de limpieza, migración o refactor masivo: el índice de Git no basta si el object store también se borra.
- ▸Usa el modo de planificación para revisar qué va a tocar el agente antes de aprobar escritura amplia.
- ▸Evita --dangerously-skip-permissions fuera de un sandbox o contenedor desechable, por más que ahorre clics.
- ▸Para tareas que tocan miles de archivos, corre el agente sobre una copia aislada del proyecto, no sobre tu working tree principal.
- ▸Ten un backup fuera del repo mismo: un espejo en la nube o un snapshot de disco que no dependa del mismo Git que el agente puede tocar.
- ▸Si trabajas en Windows, revisa symlinks y junctions antes de dejar que un agente 'limpie' carpetas temporales — son la causa más común de este tipo de accidente.
¿Y Anthropic qué dijo?
Hasta el momento de escribir esto, no hay un comunicado oficial de Anthropic sobre este incidente puntual — algo esperable dado que la fuente es un post de Reddit y no un reporte que la empresa esté obligada a reconocer. Lo que sí confirmó Anthropic esta semana, en su reporte de inteligencia de amenazas de septiembre, es que viene reforzando salvaguardas contra el mal uso de sus modelos en otros frentes: distilación no autorizada, actividad maliciosa detectada y bloqueada. La seguridad frente a comandos destructivos ejecutados por accidente, en cambio, sigue siendo terreno del usuario — se resuelve con la configuración de permisos, no con un parche del proveedor.
Aprende Claude Code con buenas prácticas desde el día uno
Si estás por integrar Claude Code en tu flujo de trabajo (o ya lo usas pero sin una rutina clara de permisos y backups), en Claude Code For Developer armamos justo ese criterio: cuándo automatizar, cuándo pedir confirmación y cómo estructurar un proyecto para que un agente trabaje sin poner en riesgo tu historial. Cubrimos configuración de hooks, revisión de diffs antes de cada commit automático y cómo armar un flujo de respaldo que no dependa del mismo repositorio que el agente puede tocar — el tipo de detalle que separa a un equipo que usa el agente con confianza de uno que un día se encuentra con un mensaje como el de Craig. Si tu meta es ir más allá del uso individual y construir sistemas de agentes en producción con esos mismos cuidados, la ruta AI Agentic Engineer cubre ese salto.
Si quieres comparar notas sobre casos como este con otros developers que ya meten agentes en su día a día, cada semana hacemos un taller en vivo en la Comunidad AI Builders.
Claude Code no es peligroso por sí solo — lo es la combinación de permisos amplios y cero puntos de control. Revisa Claude Code a fondo antes de darle acceso a tu próximo proyecto, aprende a usarlo con criterio en Claude Code For Developer o mira el resto de nuestros cursos de IA.



