Claude Code o Codex: el mejor agente cambia entre construir y revisar

|Autor: Equipo editorial de QUASA|6 lectura mínima
Claude Code o Codex: el mejor agente cambia entre construir y revisar

Para elegir entre Claude Code y Codex, importa dónde transcurre el trabajo y qué se espera del resultado. Claude Code encaja bien en una sesión cercana al repositorio, con cambios que el desarrollador sigue mientras ocurren; Codex resulta especialmente útil cuando una tarea debe continuar en la nube y retomarse después. Para revisar un borrador de Codex, una prueba controlada favorece a Claude como segunda pasada.

Al construir una aplicación, la respuesta depende también de si se priorizan rapidez, organización del código o controles de acceso. Las pruebas publicadas separan esas dimensiones: un agente puede terminar antes y dejar trabajo de reparación, mientras una revisión que mejora soluciones breves puede introducir regresiones al invertir los papeles. Ninguna de esas medidas sustituye las pruebas del proyecto.

Acceso e instalación: qué hace falta para empezar

La guía de instalación de Anthropic exige una cuenta Pro, Max, Team, Enterprise o Console para Claude Code; el plan gratuito de Claude no incluye el acceso. Documenta instalación nativa en macOS, Linux y Windows, además de opciones mediante gestores de paquetes. En terminal, se abre el directorio del proyecto y se ejecuta claude; también existe una aplicación de escritorio para quien prefiere una interfaz gráfica.

Trabajo local y tareas que siguen en la nube

La presentación oficial de Codex lo sitúa en ChatGPT, el editor y el terminal, y describe entornos de nube reutilizables por repositorio. También contempla varios agentes en paralelo y revisión de solicitudes de cambio. La elección no se reduce, por tanto, a «Claude local, Codex remoto»: Codex trabaja junto al editor y Claude Code también ofrece una aplicación fuera del terminal.

La ayuda de Codex Cloud precisa que un entorno publicado reúne repositorios, herramientas, dependencias y permisos, y que cada tarea empieza en un espacio aislado. La tarea puede continuar mientras el ordenador está inactivo y retomarse desde dispositivos compatibles. El entorno preparado se reutiliza para trabajos nuevos, pero una tarea nueva no hereda los cambios sin confirmar de otra: para compartir resultados entre ellas sigue haciendo falta control de versiones.

Seis construcciones: rapidez, calidad y fallos de acceso

En la comparación de Mike Cann, Claude Code y Codex construyeron la misma aplicación de gestión de proyectos con Convex, Supabase y Firebase: seis ejecuciones principales. El autor usó Claude Code con Opus 4.8 y Codex con GPT-5.5, aisló cada ejecución en un contenedor y fijó un límite de 45 minutos. La aplicación incluía autenticación, roles, organizaciones, tareas, comentarios y archivos; el comportamiento se revisó manualmente con una lista de 40 comprobaciones.

Con Convex y Supabase, ambos agentes alcanzaron 40 de 40 comprobaciones funcionales, aunque Codex necesitó una reparación con Supabase. En Firebase, Claude Code rebasó el tiempo previsto y el autor no pudo verificar funcionalmente su versión; Codex llegó a 34 de 40 tras tres reparaciones. Importa, por ello, si al comparar entregas se cuentan las reparaciones y si la aplicación llegó a una verificación funcional.

Codex completó antes las ejecuciones comparables; la evaluación de calidad dio a Claude Code una nota superior por backend, asociada a archivos más separados y menos atajos en los tipos. El autor repitió las configuraciones para medir duración y coste, pero esas repeticiones no equivalen a nuevas evaluaciones funcionales completas. La muestra sigue siendo una aplicación concreta, con modelos, instrucciones y tecnologías definidos.

La seguridad tampoco siguió la clasificación de velocidad o estructura. En Firebase, ambos agentes dejaron reglas que permitían al creador original recuperar privilegios después de ser retirado de una organización. En Supabase aparecieron políticas que comprobaban quién era el autor de un comentario sin verificar su pertenencia a la organización de la tarea. La evaluación combinó revisiones automatizadas con arbitraje humano; superar las pruebas de interfaz no bastó para descartar esos fallos.

Revisión cruzada: el orden cambia el resultado

El estudio de revisión cruzada evaluó 116 tareas válidas en todas sus condiciones, extraídas de problemas medios y difíciles de LiveCodeBench. Con Claude Opus 4.7 revisando soluciones de Codex GPT-5.5, la tasa de aprobación pasó del 71,6 % al 89,7 %. Al invertir los papeles, la revisión de Codex redujo la tasa de las soluciones de Claude del 91,4 % al 82,8 %.

El revisor veía el problema y el borrador, pero no podía ejecutar pruebas: tenía que entregar una solución final de Python tras inspeccionar el código. En los borradores de Codex, Claude corrigió 26 soluciones fallidas e introdujo cinco regresiones; en los de Claude, Codex corrigió tres y estropeó 13 que ya pasaban. Los cambios frente a cada borrador fueron significativos en la muestra, aunque la comparación estadística directa entre los dos órdenes no fue concluyente.

También importa la comparación correcta: Claude sin revisor obtuvo el 91,4 %, por encima del 89,7 % de la pareja Codex como autor y Claude como revisor. Claude mejoró los borradores de Codex frente al Codex solo en ese experimento; la pareja no obtuvo el mejor resultado absoluto. El estudio aísla una revisión estática de problemas acotados, mientras construir una aplicación incluye dependencias, ejecución, interfaz y autorización.

Qué elegir según el proyecto

  • Iteración cercana sobre un repositorio: Claude Code es una primera opción razonable si el equipo quiere seguir los cambios durante la sesión y valora una estructura modular. Codex también dispone de terminal y editor, así que el criterio es el flujo real de trabajo.
  • Trabajo prolongado o paralelo: Codex encaja cuando interesa preparar un entorno de nube reutilizable, lanzar tareas separadas y retomar resultados desde otro dispositivo. Cada resultado debe integrarse de forma explícita en el repositorio.
  • Segunda pasada sobre código generado: si el borrador procede de Codex, Claude como revisor tiene respaldo en la prueba controlada. Si procede de Claude, la misma prueba aconseja cautela al dejar que Codex lo reescriba sin ejecución ni pruebas.
  • Roles, permisos y archivos: cualquiera de los dos necesita comprobaciones específicas de autorización. Las construcciones muestran que una aplicación puede cumplir su lista funcional y conservar una vía para recuperar privilegios o cruzar límites entre organizaciones.

Lee también:

Compartir:

Suscríbete a nuestro boletín

Reciba las últimas noticias sobre Web3, IA y criptomonedas directamente en su bandeja de entrada.

0