Un mensaje de Codex puede iniciar varios pasos del modelo y de las herramientas. Considera el trabajo necesario para terminar la tarea, no solo los mensajes que escribes. Si no puedes iniciar la siguiente tarea, consulta primero qué hacer al alcanzar el límite.
Identifica qué estás midiendo
- Cuota del plan: lo que queda en la ventana de cinco horas o semanal de tu cuenta. ChatGPT Work y Codex comparten uso.
- Créditos: unidad de pago para el uso adicional disponible en ciertos planes. Las tarifas de créditos, por sí solas, no permiten calcular el porcentaje descontado de la cuota incluida.
- Contexto: información que el modelo puede manejar en una conversación. Su indicador no es el saldo de la suscripción.
- Facturación API: vía independiente de pago por uso al iniciar sesión con una clave API.
Consulta las tarifas oficiales, la autenticación y el comando de estado. Las estimaciones por plan y tarifas están reunidas en la página de Codex.
¿Qué decisiones cambian el consumo?
Modelo y razonamiento
Un modelo pequeño puede servir para una edición concreta; un fallo complejo y ambiguo puede requerir más razonamiento. La documentación de subagentes indica que elevar el esfuerzo de razonamiento aumenta el uso de tokens, pero no establece un porcentaje fijo por mensaje. Revisa el modelo y el nivel seleccionados antes de comparar tareas.
Archivos, resultados de herramientas y búsqueda
Los archivos y resultados de herramientas aportan información que el modelo debe procesar. Una petición corta que provoca búsquedas por el repositorio, lectura de registros y pruebas repetidas puede implicar más trabajo que una pregunta larga con todos los datos necesarios. Revisa el alcance y las líneas relevantes de la salida. La documentación del plan no establece un descuento universal fijo por comando o búsqueda web.
Entrada en caché
Las tarifas de créditos distinguen entrada normal y en caché. Caché no significa gratis, y volver a leer un archivo no demuestra un acierto de caché. La facturación de créditos de Codex no tiene un cargo separado por escribir caché; una clave API sigue las tarifas API. No conviertas un descuento API en un ahorro garantizado de cuota de suscripción.
Subagentes
Cada subagente realiza sus propias llamadas al modelo y a las herramientas. El paralelismo puede reducir la espera y aumentar el total de tokens. Compara la tarea completa, incluida la coordinación del agente principal. Tres agentes no implican exactamente el triple de cuota ni un ahorro garantizado.
Modo Fast
En los modelos compatibles, Fast aumenta la velocidad a cambio de más créditos. Comprueba /fast status en la CLI y usa /fast off si Standard basta. La guía de velocidad distingue los multiplicadores de créditos de ChatGPT de las tarifas API.
Dos ejemplos, no mediciones de ahorro
Para corregir una errata en un archivo conocido, puedes pedir solo esa edición y una revisión del diff. Una investigación del repositorio completo o una revisión paralela pueden añadir trabajo innecesario.
Para un fallo entre autenticación, almacenamiento e interfaz, investigar por separado puede resultar útil. Define responsabilidades, combina los hallazgos y verifica la solución. Terminar antes puede justificar más consumo, pero no demuestra un uso total menor.
Investiga una caída inesperada
Anota cuenta, espacio de trabajo, modelo, velocidad y límites antes y después de una tarea acotada. Revisa otras tareas simultáneas de Codex y ChatGPT Work, lecturas repetidas, reintentos y subagentes. Cambia un factor cada vez. Es un método de diagnóstico, no un experimento controlado ni una fórmula de consumo futuro.
Una cuota agotada sigue necesitando el restablecimiento de la cuenta o una opción de continuación aplicable. Reducir el trabajo posterior no devuelve el uso ya consumido.