en este artículo
No me gusta comprar algo nuevo mientras todavía tengo otra cosa que funciona. Cuando dejo de usar un equipo, primero intento venderlo. Esa decisión me llevó a construir un agente para operar mis publicaciones en Mercado Libre y terminó dándome una forma mucho más útil de probar la inteligencia artificial: darle trabajo real y revisar el resultado.
Una respuesta interesante demuestra que el modelo conversa. Un resultado verificable demuestra que puede ayudarme dentro de un flujo real.
No busco declarar cuál es el mejor modelo en abstracto. Me interesa saber cuál resuelve mejor una tarea específica, cuánto cuesta, cuánto demora y cuánta supervisión necesita.
🤖 ¿Quieres construir tu propio agente de IA?
En el AI Agents Starter Kit pasas del concepto a un agente de ventas funcionando en WhatsApp — camino no-code (Make) o técnico (n8n).
Ver el cursoEse es también el enfoque de mi benchmark público de modelos de IA: convertir un «pruébalo con algo útil» en un método repetible, con los mismos inputs y criterios observables antes de elegir.
Los chats simples son el primer filtro
La primera prueba suele ser un chat.
Le entrego al modelo una pregunta concreta, un texto para analizar o una tarea pequeña que ya forma parte de mi trabajo. Puedo pedirle que resuma un documento, proponga una respuesta, transforme información en una estructura o me ayude a pensar una solución.
Esta prueba sirve para descartar rápidamente modelos que no entienden las instrucciones, inventan información o necesitan demasiadas correcciones para entregar algo usable.
También me permite observar algo básico: ¿entiende el contexto? ¿Sigue las restricciones? ¿Distingue entre lo que sabe y lo que no sabe? ¿Entrega una respuesta que puedo revisar sin reconstruirla desde cero?
Pero un chat tiene límites. Es fácil confundir una respuesta bien escrita con una respuesta correcta. Una IA puede sonar segura, ordenada y amable mientras se equivoca en lo más importante.
Por eso no trato el resultado del chat como una conclusión. Lo uso como primer filtro.
Si una herramienta falla en una tarea sencilla y verificable, probablemente no tiene sentido llevarla todavía a un flujo más complejo. Si responde bien, solo entonces vale la pena probarla con reglas, datos y consecuencias más concretas.
Los cotizadores muestran si puede seguir reglas
El segundo tipo de prueba que me interesa son los cotizadores.
Aquí ya no basta con responder de manera razonable. Hay reglas que seguir y una salida que se puede contrastar.
Un cotizador puede tener precios, condiciones, descuentos, límites, excepciones y datos que deben mantenerse consistentes. La respuesta no depende solamente de la calidad de la redacción. Depende de que el sistema use la información correcta y aplique las reglas correspondientes.
Este tipo de tarea permite observar varios errores que en un chat normal pueden pasar desapercibidos:
- si la IA omite una condición;
- si calcula mal un valor;
- si mezcla datos de dos casos;
- si inventa una opción que no existe;
- si entrega una respuesta correcta, pero no explica cómo llegó a ella;
- si necesita demasiadas iteraciones para corregirse.
No hace falta inventar una gran prueba. Se puede empezar con un cotizador que ya exista en el trabajo de una persona: una propuesta comercial, un presupuesto, una tarifa de despacho o una configuración de producto.
Lo importante es preparar los casos antes de probar. Hay que saber cuál es la respuesta esperada, qué condiciones deben respetarse y qué errores son inaceptables.
Si no defino eso antes, termino evaluando la respuesta por intuición. Y la intuición suele favorecer a la herramienta que escribe con más seguridad, no necesariamente a la que resuelve mejor.
Mercado Libre: probar la IA dentro de una operación real
La prueba más exigente que he hecho es llevar la IA a una operación que termina en una acción externa.
Como no me gusta reemplazar un equipo que todavía funciona sin antes intentar venderlo, necesito que el proceso de publicación sea suficientemente confiable. Construí un agente que me ayuda a operar mis publicaciones en Mercado Libre.
Actualmente, todas mis publicaciones de Mercado Libre pasan por ese agente.
Tengo claro que, en esta primera experiencia, me habría demorado menos publicando directamente. Construir y probar el agente tomó más tiempo que entrar a Mercado Libre y hacer la publicación de forma manual.
Pero me gusta hacer este tipo de pruebas. Me entretiene construir el proceso, entender dónde falla y comprobar qué parte puede hacer una IA. Y, siendo honesto, lo más probable es que jamás hubiera publicado esos equipos si no hubiera decidido hacerlo de esta manera.
Ahí aparece una medida de utilidad que a veces dejamos fuera. El agente no me ahorró minutos en esta primera publicación. Lo que hizo fue convertir una tarea que probablemente habría postergado indefinidamente en una acción terminada. La prueba me permitió aprender y, al mismo tiempo, publicar algo que ya no estaba usando.
Eso no significa que cualquier automatización lenta valga la pena. Si una tarea es urgente, simple y no ofrece ningún aprendizaje reutilizable, probablemente conviene hacerla directamente. En este caso elegí otro criterio: quería probar el agente con un trabajo real y usar ese proceso para avanzar con algo que venía postergando.
El agente tampoco opera como una automatización ciega. Hay verificaciones y aprobación humana antes de las acciones externas. La IA puede ayudar a preparar información, revisar atributos, responder consultas bajo aprobación y observar el estado de una operación, pero las decisiones importantes siguen teniendo una persona detrás.
El resultado que busco no es una conversación interesante sobre ventas. Es preparar y operar una publicación real con información correcta, revisar que el estado final coincida con lo esperado y, eventualmente, vender el equipo antes de comprar otro.
En el momento de preparar este artículo, dos ejemplos visibles en mis publicaciones actuales de Mercado Libre son un Asus ROG Strix G531GW y un Apple Mac Mini M2. Son ejemplos actuales, no una promesa de que el catálogo vaya a mantenerse igual.
Este caso me obliga a probar cosas que un chat no revela:
- si los datos del producto se mantienen consistentes;
- si el agente respeta las reglas de la plataforma;
- si puedo revisar lo que hizo;
- si detecta cambios de estado;
- si evita repetir una acción;
- si una persona puede aprobar o detener el proceso antes de que ocurra algo externo.
También me obliga a separar dos cosas que suelen mezclarse: lo que el agente puede hacer y lo que está automatizado de verdad.
Publiqué meli-seller-os como el proyecto público asociado al agente y como una parte reutilizable del sistema. El repositorio no contiene las credenciales ni la configuración real de mi cuenta, que permanecen privadas.
El release público actual está acotado a operaciones controladas y no debe presentarse como un sistema público completo para crear publicaciones. Tampoco reemplaza las verificaciones ni la aprobación humana que forman parte del flujo real.
Ese límite también forma parte de la prueba. Un sistema útil no es solamente el que puede hacer más cosas. Es el que permite saber qué hizo, qué no hizo y cuándo una persona debe intervenir.
Mi método para probar una IA con trabajo real
El método no necesita empezar con una infraestructura compleja. Se puede aplicar a una tarea que ya haces esta semana.
1. Elige una tarea real
No empieces con una pregunta diseñada para que la IA se luzca. Elige algo que ya hagas con frecuencia y que consuma tiempo.
Puede ser responder consultas, preparar un presupuesto, clasificar solicitudes, resumir una reunión o completar datos de una publicación.
La tarea tiene que existir antes de la prueba. Así puedes comparar el resultado con tu proceso actual.
2. Define qué cuenta como éxito
Antes de abrir el chat, decide qué debe entregar la IA para considerar que la prueba funcionó.
La salida debe ser verificable. Por ejemplo, que no omita ciertos campos, que respete una regla de precio, que entregue una estructura determinada o que no ejecute ninguna acción sin aprobación.
También conviene anotar qué errores hacen que la prueba falle. Si una cifra incorrecta puede generar una pérdida, no debería tratarse como un detalle menor.
3. Usa el mismo input al comparar
Si pruebas dos modelos con instrucciones diferentes, no sabrás si la diferencia viene del modelo o del prompt.
Usa el mismo input, las mismas reglas y, en lo posible, el mismo formato de salida. Esto no elimina todas las diferencias entre herramientas, pero hace que la comparación sea más justa.
También evita cambiar el caso después de que un modelo falle. Si corriges el input para ayudarlo, conserva la versión original y registra la modificación.
4. Mide calidad, costo, tiempo, errores e iteraciones
No mires solamente si la respuesta «se ve bien».
Registra al menos:
- calidad de la salida;
- costo de uso;
- tiempo de respuesta;
- errores;
- cantidad de iteraciones necesarias para llegar a un resultado aceptable.
Una IA puede ser muy buena, pero demasiado cara para una tarea repetitiva. Otra puede responder rápido, pero exigir tanta revisión que no ahorre tiempo.
La medida que me importa es el resultado dentro del flujo completo. Si tengo que rehacer todo lo que entregó el modelo, la respuesta inicial no fue tan útil como parecía.
En mis pruebas también observo la latencia desde Latinoamérica, el uso de herramientas, los agentes y las tareas de negocio. Son aspectos que a veces no aparecen en una comparación puramente académica.
5. Empieza por acciones reversibles
Antes de darle acceso a una acción externa, prueba con salidas que puedas revisar y descartar.
Generar un borrador es menos riesgoso que publicarlo. Preparar una actualización es menos riesgoso que ejecutarla. Proponer un cambio es menos riesgoso que aplicarlo directamente.
Ese orden permite descubrir errores sin convertir cada prueba en un incidente.
6. Conserva la aprobación humana donde importa
Si una tarea involucra dinero, identidad o una acción externa, mantén una aprobación humana.
La IA puede preparar una respuesta, seleccionar datos o sugerir una acción. Eso no significa que deba tener la última palabra.
En mi caso, las verificaciones y las aprobaciones forman parte del proceso. No son una molestia que espero eliminar cuanto antes. Son una condición para poder usar el agente con confianza.
7. Automatiza después de validar
La automatización debe ser el resultado de una prueba que ya funcionó, no una forma de evitarla.
Primero valida la tarea manualmente. Después prueba si la IA puede ayudar con una parte. Luego mide los errores y define los límites. Solo entonces tiene sentido automatizar una sección del flujo.
Si automatizas antes de entender la tarea, también automatizas tus supuestos equivocados.
La herramienta importa menos que el flujo
Sigo probando modelos y herramientas, pero intento no convertir ese proceso en una lista de nombres.
Una IA no es útil porque aparezca primera en un ranking. Es útil cuando resuelve una tarea concreta con un costo, un tiempo y un nivel de supervisión que tienen sentido para mí.
Por eso también escribí sobre los modelos de IA que realmente uso. La elección depende del trabajo que tengo delante, no de una preferencia permanente por una marca o una familia de modelos.
Lo mismo ocurre con mi sistema de gestión de tareas con IA. El objetivo no es llenar el proceso de automatizaciones. Es reducir trabajo repetitivo sin perder visibilidad sobre lo que ocurre.
Cuando una prueba termina en una respuesta bonita, todavía falta saber si esa respuesta sirve. Cuando termina en un resultado que puedo revisar dentro de un flujo real, recién empiezo a tener evidencia.
A veces el resultado real también consiste en desbloquear una tarea que llevaba demasiado tiempo postergando. En mi caso, el agente no hizo que la primera publicación fuera más rápida. Hizo que la publicación ocurriera y me permitió aprender algo que puedo reutilizar después.
La utilidad de una IA no siempre aparece como minutos ahorrados en la primera prueba. También puede aparecer en una tarea concreta que finalmente deja de estar pendiente, siempre que el costo de construir el proceso tenga sentido para esa tarea y para lo que quiero aprender.
TL;DR
Para probar una IA de forma útil:
- elige una tarea real;
- define antes qué resultado cuenta como éxito;
- usa el mismo input para comparar;
- mide calidad, costo, tiempo, errores e iteraciones;
- empieza con acciones reversibles;
- conserva aprobación humana para dinero, identidad y acciones externas;
- automatiza solo después de validar.
Un chat convincente demuestra que una IA conversa. Una prueba útil demuestra que puede ayudarte a terminar un trabajo real.
Tres enlaces para seguir
- Mi benchmark público de modelos de IA
meli-seller-osen GitHub- Mis publicaciones actuales en Mercado Libre
Cristian Tala
🤖 ¿Quieres construir tu propio agente de IA?
En el AI Agents Starter Kit pasas del concepto a un agente de ventas funcionando en WhatsApp — camino no-code (Make) o técnico (n8n).
Ver el curso