search

Guía sobre la economía de los tokens de IA: Once principios para la ingeniería de software eficiente con tokens

person Por Luke Schlangen
source Fuente: Cloud Blog
calendar_today
schedule 4 min de lectura

Optimizar el consumo de tokens es clave para mantener a los asistentes de codificación con IA rápidos y precisos. Es posible que ya no estés escribiendo cada línea de código, pero ahora eres responsable de dirigir a esos asistentes para que se concentren en obtener el máximo provecho de cada token. El “inflado” del contexto aumenta la latencia y hace que los modelos olviden instrucciones o “alucinen”, también cuesta dinero y aleja la atención humana de los problemas que realmente importan. Los hábitos estructurados te ayudan a mantener un ciclo de retroalimentación rápido, preciso y productivo. 1. Comienza con un modelo equilibrado Cuando no estás seguro, comienza con el Gemini 3.5 Flash (razonamiento medio) predeterminado. Evalúa la complejidad a medida que avanzas. Escala a modelos más grandes o a un razonamiento más alto si una tarea falla, parece tomar demasiados pasos, o necesita un diseño complejo. 2. Usa habilidades desde el principio Evita explicar tu flujo de trabajo, reglas de prueba o entorno en cada solicitud. Pregunta, busca en línea o crea tus propias habilidades reutilizables con archivos SKILL.md y scripts. El agente las activa automáticamente, manteniendo las solicitudes limpias y evitando la búsqueda innecesaria de la documentación en línea o la inspección del código y el entorno local. 3. Automatiza con scripts y herramientas de línea de comandos Para tareas repetitivas como formatear muchos archivos o extraer datos de registro, haz que el agente cree herramientas locales simples. Usa herramientas de línea de comandos oficiales para la configuración, el linting y las pruebas. Ejecuta comandos de solo lectura para investigar el código antes de escribirlo, evitando largos ciclos de prueba y error. 4. Delega tareas intensas en salida Delega tareas intensas en salida, como la investigación profunda o la separación del trabajo de frontend y backend, a sub-agentes. Una vez que hayan terminado, solo debes reconciliar los resultados finales, en lugar de toda la trayectoria. 5. Divide y conquista David Rensin escribió “Elefantes, peces dorados y la nueva edad de oro de la ingeniería de software” que explica cómo usar sesiones de razonamiento alto y contexto largo (Elefante) para generar un plan de ejecución detallado (el Pez Dorado). Ejecuta ese plan en una sesión limpia y de bajo token. Guarda tu progreso con frecuencia con commits o artefactos para que puedas reiniciar desde un estado limpio cuando el contexto se llene. 6. Mueve la verificación a la izquierda Automatiza las pruebas temprano. Ejecuta builds y pruebas unitarias y funcionales antes de realizar pruebas de la interfaz de usuario. Pídele al agente que realice la costosa prueba “smoke” en el navegador justo antes de la entrega. Guarda los costosos bucles de verificación al final del hito. 7. Deshace cuando te desvies Si el agente se desvía y sabes la solución, usa el botón “Deshacer” en el hilo de trayectoria o revierte tus archivos. No acumules solicitudes correctivas sobre un estado roto, lo que envenena el contexto. 8. Sé específico con el contexto Sé específico en lugar de micro-administrar. Una instrucción clara con algunos errores de ortografía es mejor que una solicitud amplia y gramaticalmente correcta. De manera similar, indicar al agente el archivo, la sección o el error específico en el que te importa (con una anotación obvia // SHOULD BE X, NOT Y, FIX THIS) en lugar de enviarlo en una búsqueda abierta en una búsqueda de 10k logs va un largo camino. Siempre que sea posible, usa comentarios en línea, para que el agente sepa exactamente dónde quieres la solución. 9. Itera en las reglas Si continúas corrigiendo el comportamiento del agente, actualiza tus reglas globales en AGENTS.md o edita el archivo skill. Corrige las instrucciones en lugar de solicitar repetidamente al agente, para que el cambio persista. 10. Evita los bucles no controlados Los bucles supervisores que escanean proyectos en busca de trabajos pendientes pueden encontrar optimizaciones, pero también pueden agotar fácilmente tu presupuesto de tokens. Si ejecutas bucles, establece límites estrictos y condiciones de parada. Una alta autonomía requiere guardrails y mejores evaluaciones. No dejes que los agentes encuesten el estado en un bucle; usa activaciones basadas en eventos. 11. Inicia nuevas sesiones para cada nuevo tema Si estás continuando en el mismo tema, usar el mismo chat puede permitir que el agente reutilice el contexto existente, pero si estás cambiando de tema, inicia una nueva conversación. El agente podrá proporcionar mejores respuestas con menos tokens si solo extrae el contexto que necesita. Prioriza y gasta sabiamente Los tokens no son infinitos. Detrás de cada llamada a LLM hay una máquina física real que trabaja para producir la salida para ti. Prioriza los proyectos y funciones en las que te importa. La optimización de tokens se trata de dirigir la atención de la IA. Al usar un enfoque en capas, mantienes el desarrollo rápido y la salida nítida, mientras optimizas el gasto. Esperamos que estos 11 principios te inspiren para encontrar el equilibrio adecuado entre la dirección y la automatización en tus sesiones de IA.

Artículos relacionados

architect

El WAF de Cloudflare protege las aplicaciones de WordPress de dos vulnerabilidades de alta gravedad

Cloudflare ha implementado dos reglas de WAF en respuesta a las vulnerabilidades de alta gravedad que nos informaron el equipo de seguridad de WordPress. Las nuevas reglas protegen a todos los clientes de Cloudflare que utilizan las versiones de WordPress afectadas, pero los clientes deben actualizar inmediatamente a una versión parcheada.

architect

Componentes de Eclipse Dataspace en AWS: Estrategias de optimización de costes

Al desplegar los conectores de Eclipse Dataspace Components (EDC) en AWS, uno de los primeros desafíos que enfrentará es predecir y controlar el costo de la infraestructura necesaria. Sin criterios claros, es difícil tomar decisiones informadas sobre el dimensionamiento de la carga de trabajo, la configuración del entorno y la inversión a largo plazo. La parte 1 de esta serie de 3 artículos cubrió los fundamentos

architect

Componentes de Eclipse Dataspace en AWS: Patrones de arquitectura en producción

Ejecutar los componentes de Eclipse Dataspace (EDC) en producción en AWS requiere decisiones de arquitectura deliberadas sobre aislamiento, servicios gestionados y capas de seguridad. En la Parte 1 de esta serie, analizamos los fundamentos de las arquitecturas de espacios de datos y el EDC según los estándares de la International Data Space Association (IDSA). Si es nuevo en EDC, recomendamos comenzar por ahí.