BETA Este sitio está en versión beta. Seguimos añadiendo y revisando la información.
Descripción general del taller
Un tema a fondo. Complementa cómo funciona la IA.

Qué modelo de IA está usando

El chatbot que ve en la pantalla es un modelo concreto, y la mayoría de las herramientas ahora ofrecen varios. El menú que dice rápido, o razonamiento, o un número de versión, cambia en qué es buena la herramienta, cuánto tarda, cuánto cuesta y cuánto peso puede tener su respuesta. Cuatro diferencias cubren casi todo lo que un profesional necesita. Los nombres de ese menú seguirán cambiando cada pocos meses. Estas cuatro diferencias no.

Actividad inicial

Auditen la herramienta que ya tienen abierta

  1. Abran la herramienta de IA que realmente usan. Busquen el menú de modelos y anoten el nombre y la versión exactos del modelo.
  2. Averigüen qué plan tienen, y si es el gratuito.
  3. Busquen la configuración de datos: ¿la empresa dice que sus conversaciones se usan para entrenar el modelo? Llenen una fila por persona y guarden la tabla.

Antes de hoy, ¿habrían podido responder esas tres preguntas sobre la herramienta que usan todos los días?

La primera diferencia

Modelos rápidos y modelos de razonamiento

Todos los modelos escriben del mismo modo, un token a la vez. Lo que cambia es si el modelo trabaja algo antes de empezar a escribir.

Dos maneras de responder

Qué pasa después de que usted presiona enviar

Modelo rápido
? A

Empieza a escribir de inmediato. Sirve para borradores, para el tono y para texto que usted mismo aportó.

Modelo de razonamiento
? A

Primero escribe pasos intermedios ocultos, y después responde. Es más lento, y mejor para reglas y comparaciones.

Un modelo de razonamiento usa ese tiempo extra antes de que aparezca la primera palabra. Los pasos que le muestra después son su propio relato de cómo llegó a la respuesta, y ese relato puede omitir lo que realmente la produjo.
Lo predeterminado es el modelo rápido

Si usted no elige otra cosa, la herramienta le da un modelo pequeño, rápido y barato, porque la mayoría de las preguntas no necesitan más. Empieza a escribir de inmediato. Para reformular un correo, acortar un párrafo o resumir un documento que usted pegó, esa velocidad vale la pena y la calidad es suficiente.

Un modelo de razonamiento (reasoning model) trabaja el problema primero

Los modelos etiquetados como razonamiento o pensamiento escriben una cadena de pasos intermedios antes de mostrarle nada. Trabajar paso a paso mejora de forma medible la precisión en problemas que requieren varios pasos (Wei et al., 2022), que es justo lo que es una regla de elegibilidad con tres condiciones, o una comparación entre dos documentos. Son más lentos, a veces por un minuto entero, y cuestan más de ejecutar.

Pensar no es verificar

Los pasos que un modelo le muestra no son un registro fiel de cómo llegó a la respuesta. Unos investigadores colocaron una pista en la instrucción que cambió lo que el modelo respondía, y el modelo después escribió una explicación segura, paso a paso, que nunca mencionó esa pista (Turpin et al., 2023). Un modelo de razonamiento comete menos errores por descuido. Aun así puede equivocarse con total seguridad, y usted igual debe verificar todo aquello sobre lo que vaya a actuar.

Cuándo vale la pena esperar

Use el modelo de razonamiento cuando un error le costaría algo a su cliente, cuando la pregunta tiene más de una condición, o cuando quiere que la herramienta revise un trabajo en lugar de producirlo. El modelo rápido alcanza para el tono, para borradores y para cualquier texto que de todos modos usted iba a leer con cuidado.

Fíjese en qué modo está antes de preguntar algo que realmente importa. Cuando se le entrega una pregunta difícil al modelo rápido, lo que se obtiene casi siempre es una respuesta segura y superficial.

La segunda diferencia

El tamaño del modelo y los parámetros

Los modelos se describen por su tamaño, casi siempre un número de parámetros (parameters) como 8B, 70B o 400B. Vale la pena entender ese número, y también entender qué queda fuera de él.

Qué determina la capacidad

Tres factores, un modelo

Datos de entrenamiento Cómputo Parámetros Qué tan capaz es el modelo
Subir solo uno desperdicia los otros dos
La capacidad surge de los tres factores juntos. Los laboratorios cerrados no publican ninguno de ellos, así que la afirmación de que un modelo es más grande o está mejor entrenado que otro casi nunca puede verificarse desde afuera.
Dónde funciona

Centro de datos, laptop o teléfono

Grande, en un centro de datosEl más fuerte, con la mayor cobertura de idiomas. Su texto viaja hasta la empresa que lo opera.
Mediano, el predeterminado de todos los díasLo que la mayoría de los chatbots le dan primero. Rápido, y suficiente para redactar borradores.
Pequeño, en su propio dispositivoFunciona sin conexión, el texto se queda en la máquina, y es el más débil en los idiomas de sus clientes.
El tamaño determina dónde puede funcionar un modelo, y por lo tanto hasta dónde viaja su texto. Los modelos más fuertes son los que usted no puede alojar por su cuenta, y los que sí puede alojar son los más débiles en los idiomas que hablan sus clientes.
Un parámetro es un ajuste interno

El entrenamiento ajusta miles de millones de números internos hasta que la predicción del modelo sobre el siguiente token coincide con el texto del que está aprendiendo. Esos números son los parámetros, y son lo único que el modelo conserva. Contarlos, ya sean 8000 millones o 400.000 millones, mide cuánto patrón le cabe al modelo. No es un conteo de datos concretos, porque el modelo no guarda ninguno.

Los datos, el cómputo y el tamaño funcionan juntos

Tres factores determinan qué tan capaz resulta un modelo: cuánto texto usó para aprender, cuánto cómputo se invirtió en entrenarlo, y cuántos parámetros tiene. La calidad mejora de forma gradual con los tres a la vez, y subir solo uno desperdicia los otros dos (Kaplan et al., 2020). Si entrena un modelo grande con muy poco texto, un modelo más pequeño entrenado con más texto lo superará (Hoffmann et al., 2022). Las empresas que venden modelos cerrados no publican ninguno de los tres datos, así que ni siquiera la afirmación de que un modelo es más grande que otro suele poder verificarse desde afuera.

Modelos grandes y modelos pequeños

Un modelo de lenguaje grande (large language model), con cientos de miles de millones de parámetros, funciona en un centro de datos (data center) y llega hasta usted por internet. Un modelo de lenguaje pequeño (small language model), con unos pocos miles de millones de parámetros, funciona en una laptop o un teléfono sin ninguna conexión a internet. Los modelos pequeños son baratos, rápidos y privados, y son notablemente más limitados. Hoy ambos se construyen a propósito, para tareas distintas.

Un modelo pequeño puede especializarse

Un modelo pequeño no será bueno en todo. Si se lo entrena más a fondo en una tarea específica, puede competir de igual a igual con un modelo generalista mucho más grande en esa misma tarea, y un modelo grande puede usarse para enseñarle a uno pequeño, un método llamado destilación (distillation) (Hinton et al., 2015). No generalizará más allá de su carril. Dentro de ese carril, a menudo hace el trabajo con una fracción del cómputo y de la electricidad, lo cual importa tanto para el costo como para la huella ambiental.

El tamaño se nota primero en los idiomas de sus clientes

Los tokenizadores (tokenizers) cortan el inglés en pocas piezas y muchos otros idiomas en muchas más, hasta cinco veces más para el mismo contenido, así que la misma solicitud cuesta más, tarda más y llena antes la memoria de trabajo del modelo cuando se usa en los idiomas de sus clientes (Ahia et al., 2023). Al reducir un modelo, los idiomas que menos vio durante el entrenamiento son los primeros en resentirse. Un modelo pequeño que lee bien en inglés suele ser notablemente peor en vietnamita, amárico o criollo haitiano.

El tamaño le dice qué puede contener un modelo y dónde puede funcionar. No dice nada sobre si una respuesta en particular es cierta.

La tercera diferencia

Modelos abiertos y modelos cerrados

Esta diferencia trata de quién tiene el modelo y si alguien fuera de la empresa puede ejecutarlo.

Dos arreglos

Nube cerrada y pesos abiertos

Modelo cerrado, en la nube de la empresa

Su texto va a la empresa y regresa una respuesta. Suelen ser los modelos más fuertes y con más cobertura de idiomas. La empresa pone las condiciones, se queda con el modelo, y puede cambiarlo sin avisarle.

Pesos abiertos, en hardware que usted controla

Usted descarga el modelo y lo ejecuta por su cuenta. El texto puede quedarse en la máquina. Cuesta hardware, instalación y tiempo del personal, y los modelos que realmente puede ejecutar son más pequeños y más débiles.

El arreglo que más protege el texto del cliente es también el que peor responde en los idiomas de sus clientes. La mayoría de las agencias terminan usando una herramienta cerrada, con una regla escrita sobre qué se puede escribir en ella.
Un modelo cerrado (closed model) es acceso alquilado

Los asistentes más conocidos son cerrados. La empresa se queda con los parámetros entrenados, y usted llega al modelo a través de su aplicación o de su interfaz de programación. Usted no puede inspeccionarlo, no puede ejecutarlo por su cuenta, y no puede conservarlo cuando la empresa lo cambia o lo retira. La empresa tampoco está obligada a decirle con qué se entrenó el modelo, qué tan grande es, o qué cambió en la última actualización, y casi nunca lo hace. Su texto viaja hasta los servidores de la empresa para obtener una respuesta.

Un modelo de pesos abiertos (open weights) se puede descargar

Otras empresas publican los parámetros entrenados, así que cualquiera puede descargar el modelo y ejecutarlo en su propia computadora o en el servidor de su agencia. Por eso una laptop sin conexión a internet puede seguir respondiéndole, y por eso un proveedor pequeño puede construir un producto sin alquilarle un modelo a nadie.

Pesos abiertos no es lo mismo que código abierto (open source)

Los pesos publicados son los números ya terminados. Los datos de entrenamiento (training data) y el código de entrenamiento que los produjeron suelen permanecer privados, así que nadie de afuera puede estudiar el modelo ni reconstruirlo, y la Open Source Initiative reserva el término código abierto para los modelos que publican lo suficiente para permitir eso (Open Source Initiative, 2024). Las licencias también varían. Algunos modelos de pesos abiertos tienen licencias permisivas estándar, y otros tienen condiciones propias que restringen quién puede usarlos y para qué. Lea la licencia antes de que su agencia construya algo sobre uno de ellos.

Dónde esto llega hasta sus clientes

Un modelo que funciona en hardware que su agencia controla es el único arreglo en el que el texto del cliente nunca sale del edificio, y esa es una razón real para que le importen los pesos abiertos. También es fácil exagerar su alcance. Una aplicación puede construirse sobre un modelo abierto y aun así enviar cada palabra a un servidor en la nube. Pregunte adónde va el texto, y consiga la respuesta por escrito.

Abierto y cerrado no es una clasificación de calidad, ni de seguridad. Determina quién puede ejecutar el modelo y hasta dónde viaja su texto, y eso es antes que nada una pregunta sobre sus clientes, no sobre tecnología.

La cuarta diferencia

Los datos de entrenamiento y las fechas de corte

Dos modelos del mismo tamaño pueden comportarse de forma muy distinta. Un modelo está hecho del texto que vio y del ajuste (fine-tuning) que recibió después.

Datos de entrenamiento que usted no puede ver

Estos modelos aprendieron de una cantidad enorme de texto tomado de internet, además de material con licencia y material comprado. La mayoría de los modelos cerrados nunca publica esa lista, así que usted no puede comprobar si el modelo vio algo bueno sobre la regla que está consultando. El texto de internet está dominado por el inglés y es escaso en la mayoría de los idiomas de sus clientes, y ahí empieza la brecha lingüística.

Una fecha de corte (cutoff), con una búsqueda añadida

El entrenamiento se detiene en una fecha, y la memoria entrenada del modelo se detiene con él. Muchas herramientas ahora hacen una búsqueda en internet en vivo para llegar más allá de esa fecha, lo cual ayuda y a la vez cambia la pregunta. La respuesta entonces vale tanto como las páginas que la herramienta llegó a consultar, así que pregunte qué fuentes usó y ábralas.

Un documento largo no se lee de forma pareja

Un dato que está al principio o al final de un texto largo se encuentra con mucha más fiabilidad que el mismo dato enterrado en el medio, y la precisión baja a medida que el texto se alarga (Liu et al., 2024). Pegue una política de cuarenta páginas, haga una pregunta puntual, y la respuesta puede pasar por alto un párrafo que el modelo técnicamente leyó. Cite el fragmento que le interesa en lugar de entregar todo el documento.

El ajuste que viene después

Una vez que un modelo puede predecir texto, se lo ajusta con retroalimentación humana para que siga instrucciones, responda con cierto tono y rechace ciertas solicitudes (Ouyang et al., 2022). Esa etapa, y no el tamaño, es la razón de que dos modelos se sientan distintos en una conversación. Esa etapa también premia estar de acuerdo. Los asistentes entrenados así tienden a alinearse con la opinión que expresa el usuario, y abandonan una respuesta correcta cuando el usuario insiste en lo contrario (Sharma et al., 2024). Dele al modelo una premisa equivocada y espere que construya sobre ella.

Las versiones cambian sin que usted lo note

Los modelos se reentrenan y se actualizan, a veces sin aviso, y el mismo nombre en el menú puede corresponder a una maquinaria distinta a la del mes pasado. Vuelva a probar una instrucción guardada después de una actualización, junto con el juicio que se había formado sobre lo que esa herramienta hace bien.

El entrenamiento es la parte que usted no puede inspeccionar ni corregir, y determina cómo se comporta el modelo en vietnamita, en una regla del condado y en un cambio de política del mes pasado. Suponga que es escaso justo donde está su trabajo.

Regla práctica

Qué modelo para qué tarea

Qué está haciendo Qué usar Reformular un correo, acortar un párrafo, ordenar notas que usted escribió El modelo rápido predeterminado. Lo que quiere es velocidad, y usted mismo puede ver el contenido que entró. Desenredar una regla de elegibilidad, comparar dos documentos, revisar un formulario en busca de contradicciones Un modelo de razonamiento, y después verificar los detalles contra la fuente oficial. Una oficina local, un plazo, una tarifa, un cambio de política reciente Cualquier modelo, con la búsqueda web activada, y abra las fuentes que cita. La memoria entrenada por sí sola no basta. Cualquier cosa en el idioma de un cliente que tenga consecuencias Un intérprete o traductor calificado. Ningún modelo, abierto o cerrado, grande o pequeño, reemplaza eso. Cualquier cosa que contenga información que identifique a un cliente Ninguna herramienta en la nube, a menos que su agencia la haya aprobado por escrito. Quite primero los datos identificables.
Dos de estas filas no tratan sobre modelos en absoluto, y esas dos son las que cargan más riesgo.
Vale la pena saberlo
  • El nivel gratuito de una herramienta suele ser su modelo más liviano. Si la pregunta tiene consecuencias, revise qué modelo está usando.
  • Un modelo etiquetado como razonamiento no es un modelo que verifica hechos.
  • Dos productos pueden funcionar sobre el mismo modelo de base y aun así comportarse distinto, porque la empresa que lo envuelve le agrega sus propias instrucciones.
  • Los puntajes de referencia (benchmarks) en un anuncio de lanzamiento se miden con tareas que no son las suyas, en un idioma que probablemente no es el de su cliente.
  • Un modelo abierto no protege por sí solo los datos del cliente. Solo lo hace ejecutarlo en hardware que usted controla, y la mayoría de las aplicaciones construidas sobre modelos abiertos no lo hacen.
Pruebe esto

Averigüe qué modelo está usando

Tómense cinco minutos para que cada persona abra el menú de modelos en la herramienta de IA que realmente usa, y anote el nombre y la versión exactos. Ahora denle al grupo una pregunta que contenga una regla, algo con un límite de ingresos y un plazo. La mitad del grupo se la hace al modelo rápido, la otra mitad al modelo de razonamiento. Lean algunas respuestas en voz alta. La diferencia en el cuidado se nota, y también se nota que las dos igual necesitan verificarse.

Fuentes de esta página
  1. Ahia, O., Kumar, S., Gonen, H., Kasai, J., Mortensen, D. R., Smith, N. A., & Tsvetkov, Y. (2023). Do all languages cost the same? Tokenization in the era of commercial language models. Proceedings of EMNLP 2023, 9904-9923. https://doi.org/10.18653/v1/2023.emnlp-main.614
  2. Hinton, G., Vinyals, O., & Dean, J. (2015). Distilling the knowledge in a neural network. arXiv:1503.02531. https://arxiv.org/abs/1503.02531
  3. Hoffmann, J., Borgeaud, S., Mensch, A., et al. (2022). Training compute-optimal large language models. Advances in Neural Information Processing Systems 35. https://arxiv.org/abs/2203.15556
  4. Kaplan, J., McCandlish, S., Henighan, T., et al. (2020). Scaling laws for neural language models. arXiv:2001.08361. https://arxiv.org/abs/2001.08361
  5. Liu, N. F., Lin, K., Hewitt, J., Paranjape, A., Bevilacqua, M., Petroni, F., & Liang, P. (2024). Lost in the middle: How language models use long contexts. Transactions of the Association for Computational Linguistics, 12, 157-173. https://doi.org/10.1162/tacl_a_00638
  6. Open Source Initiative. (2024). The Open Source AI Definition 1.0. https://opensource.org/ai/open-source-ai-definition
  7. Ouyang, L., Wu, J., Jiang, X., et al. (2022). Training language models to follow instructions with human feedback. Advances in Neural Information Processing Systems 35. https://arxiv.org/abs/2203.02155
  8. Sharma, M., Tong, M., Korbak, T., et al. (2024). Towards understanding sycophancy in language models. International Conference on Learning Representations (ICLR) 2024. https://arxiv.org/abs/2310.13548
  9. Turpin, M., Michael, J., Perez, E., & Bowman, S. R. (2023). Language models don't always say what they think: Unfaithful explanations in chain-of-thought prompting. Advances in Neural Information Processing Systems 36. https://arxiv.org/abs/2305.04388
  10. Vaswani, A., Shazeer, N., Parmar, N., et al. (2017). Attention is all you need. Advances in Neural Information Processing Systems 30. https://arxiv.org/abs/1706.03762
  11. Wei, J., Wang, X., Schuurmans, D., et al. (2022). Chain-of-thought prompting elicits reasoning in large language models. Advances in Neural Information Processing Systems 35. https://arxiv.org/abs/2201.11903