Artículo

Modelo y esfuerzo: qué hace cada uno de los dos ajustes

·

11 min de lectura

Seguramente lo hayas visto sin fijarte demasiado al interactuar con casi cualquier herramienta de inteligencia artificial. Arriba, en una esquina, hay un desplegable con nombres de modelos. Y cerca hay otro ajuste que, según la herramienta, se llama de una manera o de otra: «nivel de esfuerzo», «pensar más», «razonamiento extendido». A veces es una barra que deslizas y a veces una lista con niveles del tipo bajo, medio, alto.

Aunque la interfaz no siempre te los enseñe por separado, por debajo hay dos decisiones distintas. El de modelo selecciona el sistema que responde. Qué versión queremos usar. Cada modelo tiene un perfil propio de capacidad, velocidad y coste: elegir uno se parece a elegir a quién le encargas el trabajo. El de esfuerzo actúa dentro del modelo seleccionado y gradúa cuánto trabajo dedica a la respuesta. Es una escala ordenada, así que aunque aparezca como una lista, funciona como un regulador.

Es fácil no tocarlos nunca: vienen puestos de fábrica, no vienen explicados, y la herramienta funciona igual si los dejas como están. El problema es que luego el resultado, bueno o malo, acaba pareciendo cosa de la tecnología, cuando muchas veces era cosa de esas dos opciones.

La idea que quiero dejarte es sencilla: elegir modelo es elegir con qué capacidades cuentas. Elegir esfuerzo es elegir cuánta parte de esas capacidades se dedica a esta pregunta concreta. Y no son lo mismo, aunque desde fuera lo parezcan.

Figura 1. Los dos mandos son independientes. El selector determina qué modelo responde; el regulador fija cuánto razonamiento dedica antes de entregar el resultado.


La comparación que a mí me sirve

Piensa en encargarle algo a alguien de tu equipo.

Elegir modelo se parece a decidir a quién se lo encargas: a alguien con quince años de oficio o a alguien que acaba de llegar. Elegir el nivel de esfuerzo se parece a decidir cuánto tiempo le das: media hora o toda la tarde.

Figura 2. La comparación: el modelo equivale a elegir a quién encargas el trabajo; el esfuerzo, a decidir cuánto tiempo le das. Más tiempo puede mejorar el proceso, pero no sustituye las capacidades que faltan.

Si fuerzas un poco la comparación, se ve dónde está el límite. Alguien recién llegado, con toda la tarde por delante, puede hacerlo mejor que un veterano con media hora. Pasa siempre que la tarea se resuelve revisando, comprobando y siendo metódico. Pero hay un tipo de encargo donde no lo consigue ni con una semana: el que exige saber algo que todavía no sabe.

Más esfuerzo da más margen para analizar y comprobar, y eso puede llegar bastante lejos: en algunas tareas estructuradas, un modelo intermedio con esfuerzo alto puede acercarse a uno mayor con esfuerzo bajo. No es una regla universal. Y lo que no hace es enseñarle lo que no sabe.

De ahí sale lo primero que conviene tener claro: subir el esfuerzo exprime mucho mejor el modelo que tienes, pero no lo convierte en otro. Si la tarea pide un criterio o un conocimiento que ese modelo no tiene, más deliberación no lo fabrica, y lo que sale es una respuesta más completa pero no más acertada.

Figura 3. Aumentar el esfuerzo puede mejorar la respuesta, pero el beneficio acaba alcanzando un techo: el límite de capacidades y conocimientos del modelo seleccionado.


Cuándo merece la pena que piense más

Hay un patrón bastante fiable.

Pensar más ayuda cuando la respuesta se construye paso a paso: problemas donde cada paso parte del anterior, cuentas largas, código con piezas que dependen unas de otras, planificar con restricciones que chocan entre sí. En estos casos, pensar más es recorrer el camino otra vez por otra ruta y ver si se llega al mismo sitio.

Pensar más aporta poco cuando la tarea es una transformación directa y bien definida: cambiar un formato, sacar cuatro datos de un documento que ya tienes delante, clasificar correos, acortar un texto un veinte por ciento. Ojo, que reescribir no siempre es eso: reordenar un informe entero o detectar que un argumento se contradice sí es trabajo de pensar. Aquí no hay nada que deliberar, así que la deliberación solo cuesta tiempo y dinero.

Y hay un tercer caso que se lleva mucho dinero: las tareas de mucho volumen. Miles de clasificaciones al día, resúmenes automáticos, etiquetados. Un ajuste que parece menor en una petición suelta se multiplica por cien mil y aparece en la factura a fin de mes.


Cómo decidir sin complicarse

A mí me funciona una cuenta mental muy simple: cuánto depende de esa respuesta × cuánto de difícil es la tarea. Y de los dos, el que se nos olvida siempre es el primero, porque solo miramos la pregunta que tenemos delante.

Si de la respuesta no depende gran cosa, como un borrador que vas a revisar igualmente o una clasificación que se arregla en dos clics, modelo modesto y esfuerzo bajo. Se corrige en un segundo y además son muchas.

Si depende bastante, como un número que va a servir para decidir una inversión, un texto que se publica, un asunto legal o médico, o código que se ejecuta sin que lo mire nadie, justo lo contrario. Y sube también la comprobación: para una cifra, pide el cálculo aparte; para lo jurídico, contrasta la norma vigente; para el código, tests. Y da igual que la tarea parezca fácil: cuando depende mucho de la respuesta, sube igual. Lo que peor se detecta es lo que sale mal sin llamar la atención, y eso no se descubre hasta mucho después.

La mejor combinación casi nunca es «todo al máximo». Suele ser cruzada.

  • Modelo bueno y esfuerzo bajo va sorprendentemente bien cuando hace falta criterio pero no cadena de razonamiento: redactar con gusto, decidir un enfoque, darse cuenta de que la pregunta está mal planteada.
  • Modelo modesto y esfuerzo alto va bien en problemas estructurados y de dificultad media, donde manda el procedimiento y no el conocimiento especializado: resolver restricciones, transformar código, planificar por pasos. Para lo puramente mecánico y masivo, en cambio, esta combinación solo encarece.

Entender esas dos cruzadas sirve más que cualquier tabla comparativa.

Figura 4. La combinación adecuada depende de dos variables: la dificultad de la tarea y cuánto depende de acertar. Las tareas mecánicas y de poco impacto quedan en la zona baja; las difíciles o de alto riesgo exigen más capacidad, esfuerzo y comprobación.


Y esto, ¿cuánto cuesta?

Es la pregunta obvia y la interfaz casi nunca te la contesta. Depende de cómo uses la herramienta.

Si tienes una suscripción, normalmente no ves un precio por cada respuesta: consumes los límites o los créditos que incluye tu plan. Ahí el precio se paga en límites, y la propia aplicación suele avisarte con etiquetas del tipo «consume tus límites más rápido» o «requiere créditos de uso». No hay un número exacto que consultar, así que la manera práctica de aprenderlo es fijarte en cuánto te dura la cuota una semana normal, subir un escalón y ver cuánto te dura ahora.

Si trabajas por uso, con acceso de desarrollador o herramientas que cobran por consumo, sí hay tarifa publicada. Los proveedores tienen una página de precios con el coste de cada modelo, y verás dos números: uno por lo que envías y otro por lo que te responde. El nivel de esfuerzo no suele tener un precio separado. Lo que cambia es la cantidad de razonamiento que genera el sistema antes de responder. En las APIs de OpenAI y Anthropic, esos tokens de razonamiento se contabilizan dentro de la salida; Google también indica que el precio se basa en todos los tokens de pensamiento generados, aunque solo se muestre un resumen. Por eso subir el esfuerzo puede encarecer una consulta sin cambiar de modelo.

Figura 5. Una respuesta visible puede ser breve aunque el sistema haya generado muchos tokens de razonamiento. Ese trabajo intermedio puede aumentar tanto el coste como el tiempo de respuesta.

Y lo que conviene tener presente: los efectos de los dos ajustes pueden multiplicarse. Pasar a un modelo con una tarifa mayor y subir a la vez la cantidad de razonamiento combina un coste por token más alto con más tokens generados. Si quieres entender el impacto real, mueve primero un ajuste y después el otro.

Y hay un factor que no aparece en ninguna comparativa pero decide mucho: lo que estás dispuesto a esperar. Una herramienta que responde en quince segundos la consultas en cuanto te surge la duda. Una que tarda tres minutos la consultas cuando ya has decidido por tu cuenta. Dejarlo todo al máximo por defecto no te da mejores respuestas: te lleva a preguntar menos.


¿Y si lo dejo en automático?

Cada vez más herramientas traen una opción automática que elige por ti, a veces el modelo, a veces el nivel de esfuerzo, a veces los dos. Y es una opción perfectamente razonable. Para el día a día funciona bien y te ahorra estar pendiente.

Ayuda saber qué está estimando. En esencia, decide si tu petición se beneficia de más razonamiento y actúa en consecuencia: si parece sencilla, responde rápido; si parece exigente, sube. Cómo lo hace exactamente depende de cada proveedor y no siempre se publica con detalle, pero para el uso cotidiano puede funcionar bien.

Y ahí está el límite. Puede estimar bastante bien cuánto razonamiento parece pedir una petición. Lo que no puede saber, si tú no se lo cuentas, es qué depende de esa respuesta. No sabe que esa cifra va a decidir una compra de doscientos mil euros a menos que se lo hayas dicho en la conversación. Y eso era justamente lo que más importaba de los dos factores.

Figura 6. El modo automático puede estimar la complejidad de la petición, pero desconoce sus consecuencias reales. Para ajustar bien la respuesta hay que explicarle el contexto y qué está en juego.

Así que la regla es cómoda: deja el automático puesto para lo de todos los días y toma el control cuando dependa algo de la respuesta. No hace falta más análisis que ese.

Hay un detalle menor que conviene tener en mente. En automático no siempre sabes qué te ha respondido, y dos preguntas parecidas pueden acabar en modelos distintos. Si estás comparando resultados, probando un prompt o intentando entender por qué hoy sale peor que ayer, fija tú los dos ajustes. Vas a tardar menos en enterarte de lo que pasa.


El 1% técnico, y lo dejamos

Solo hace falta entender una cosa de lo que ocurre por debajo.

El «esfuerzo» regula cuánto razonamiento intermedio produce el sistema antes de darte la respuesta final. Ese razonamiento se genera en forma de tokens, las unidades en las que se mide y se cobra todo lo demás, y cuenta aunque tú no lo veas. Por eso una respuesta corta puede salir cara: lo caro no fue lo que te dijo, sino lo que pensó para decírtelo.

Ya está. Con esto vas sobrado para decidir bien.


Dónde puede fallarte esto

Cuatro consideraciones para terminar:

Uno. Las equivalencias entre modelos no son estables. Los proveedores cambian modelos, precios, capacidades y hasta la forma de controlar el razonamiento cada pocos meses, así que una combinación que hoy va muy bien puede dejar de ser la mejor con la siguiente generación. Por eso nos interesa entender el mecanismo y no memorizar nombres.

Dos. No siempre sabemos de antemano cuánto razonamiento necesita una tarea. Un problema que parece tonto puede esconder la dificultad en el cuarto paso. Por eso lo robusto es empezar con una configuración razonable y subir si el resultado no convence. Y que repetir la pregunta con más capacidad nos cueste poco forma parte del sistema, no es un detalle.

Tres. Más razonamiento no sustituye a la comprobación. Un modelo puede razonar durante mucho rato partiendo de una premisa equivocada, y sonará igual de convencido. Si la respuesta importa de verdad, comprobarla sigue siendo responsabilidad nuestra.

Y cuatro. Ninguno de estos ajustes arregla una pregunta mal planteada. Podemos coger el mejor modelo disponible, ponerle el máximo esfuerzo y pedirle además que revise su respuesta tres veces: si el problema está mal formulado, quizá lo único que consigamos sea una respuesta equivocada mucho más elaborada. El ajuste más rentable de todos sigue siendo uno que no aparece en ninguna pantalla: el minuto que dedicamos a saber exactamente qué estamos preguntando.


Fuentes oficiales

Recibe los trucos por correo

Cada martes, los trucos que he publicado esa semana en el blog. Directos a tu buzón.

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *