Qué modelo de IA está usando
El chatbot que ve en la pantalla es un modelo concreto, y la mayoría de las herramientas ahora ofrecen varios. El menú que dice rápido, o razonamiento, o un número de versión, cambia en qué es buena la herramienta, cuánto tarda, cuánto cuesta y cuánto peso puede tener su respuesta. Cuatro diferencias cubren casi todo lo que un profesional necesita. Los nombres de ese menú seguirán cambiando cada pocos meses. Estas cuatro diferencias no.
Auditen la herramienta que ya tienen abierta
- Abran la herramienta de IA que realmente usan. Busquen el menú de modelos y anoten el nombre y la versión exactos del modelo.
- Averigüen qué plan tienen, y si es el gratuito.
- Busquen la configuración de datos: ¿la empresa dice que sus conversaciones se usan para entrenar el modelo? Llenen una fila por persona y guarden la tabla.
Antes de hoy, ¿habrían podido responder esas tres preguntas sobre la herramienta que usan todos los días?
Modelos rápidos y modelos de razonamiento
Todos los modelos escriben del mismo modo, un token a la vez. Lo que cambia es si el modelo trabaja algo antes de empezar a escribir.
Qué pasa después de que usted presiona enviar
Empieza a escribir de inmediato. Sirve para borradores, para el tono y para texto que usted mismo aportó.
Primero escribe pasos intermedios ocultos, y después responde. Es más lento, y mejor para reglas y comparaciones.
Si usted no elige otra cosa, la herramienta le da un modelo pequeño, rápido y barato, porque la mayoría de las preguntas no necesitan más. Empieza a escribir de inmediato. Para reformular un correo, acortar un párrafo o resumir un documento que usted pegó, esa velocidad vale la pena y la calidad es suficiente.
Los modelos etiquetados como razonamiento o pensamiento escriben una cadena de pasos intermedios antes de mostrarle nada. Trabajar paso a paso mejora de forma medible la precisión en problemas que requieren varios pasos (Wei et al., 2022), que es justo lo que es una regla de elegibilidad con tres condiciones, o una comparación entre dos documentos. Son más lentos, a veces por un minuto entero, y cuestan más de ejecutar.
Los pasos que un modelo le muestra no son un registro fiel de cómo llegó a la respuesta. Unos investigadores colocaron una pista en la instrucción que cambió lo que el modelo respondía, y el modelo después escribió una explicación segura, paso a paso, que nunca mencionó esa pista (Turpin et al., 2023). Un modelo de razonamiento comete menos errores por descuido. Aun así puede equivocarse con total seguridad, y usted igual debe verificar todo aquello sobre lo que vaya a actuar.
Use el modelo de razonamiento cuando un error le costaría algo a su cliente, cuando la pregunta tiene más de una condición, o cuando quiere que la herramienta revise un trabajo en lugar de producirlo. El modelo rápido alcanza para el tono, para borradores y para cualquier texto que de todos modos usted iba a leer con cuidado.
Fíjese en qué modo está antes de preguntar algo que realmente importa. Cuando se le entrega una pregunta difícil al modelo rápido, lo que se obtiene casi siempre es una respuesta segura y superficial.
El tamaño del modelo y los parámetros
Los modelos se describen por su tamaño, casi siempre un número de parámetros (parameters) como 8B, 70B o 400B. Vale la pena entender ese número, y también entender qué queda fuera de él.
Tres factores, un modelo
Centro de datos, laptop o teléfono
El entrenamiento ajusta miles de millones de números internos hasta que la predicción del modelo sobre el siguiente token coincide con el texto del que está aprendiendo. Esos números son los parámetros, y son lo único que el modelo conserva. Contarlos, ya sean 8000 millones o 400.000 millones, mide cuánto patrón le cabe al modelo. No es un conteo de datos concretos, porque el modelo no guarda ninguno.
Tres factores determinan qué tan capaz resulta un modelo: cuánto texto usó para aprender, cuánto cómputo se invirtió en entrenarlo, y cuántos parámetros tiene. La calidad mejora de forma gradual con los tres a la vez, y subir solo uno desperdicia los otros dos (Kaplan et al., 2020). Si entrena un modelo grande con muy poco texto, un modelo más pequeño entrenado con más texto lo superará (Hoffmann et al., 2022). Las empresas que venden modelos cerrados no publican ninguno de los tres datos, así que ni siquiera la afirmación de que un modelo es más grande que otro suele poder verificarse desde afuera.
Un modelo de lenguaje grande (large language model), con cientos de miles de millones de parámetros, funciona en un centro de datos (data center) y llega hasta usted por internet. Un modelo de lenguaje pequeño (small language model), con unos pocos miles de millones de parámetros, funciona en una laptop o un teléfono sin ninguna conexión a internet. Los modelos pequeños son baratos, rápidos y privados, y son notablemente más limitados. Hoy ambos se construyen a propósito, para tareas distintas.
Un modelo pequeño no será bueno en todo. Si se lo entrena más a fondo en una tarea específica, puede competir de igual a igual con un modelo generalista mucho más grande en esa misma tarea, y un modelo grande puede usarse para enseñarle a uno pequeño, un método llamado destilación (distillation) (Hinton et al., 2015). No generalizará más allá de su carril. Dentro de ese carril, a menudo hace el trabajo con una fracción del cómputo y de la electricidad, lo cual importa tanto para el costo como para la huella ambiental.
Los tokenizadores (tokenizers) cortan el inglés en pocas piezas y muchos otros idiomas en muchas más, hasta cinco veces más para el mismo contenido, así que la misma solicitud cuesta más, tarda más y llena antes la memoria de trabajo del modelo cuando se usa en los idiomas de sus clientes (Ahia et al., 2023). Al reducir un modelo, los idiomas que menos vio durante el entrenamiento son los primeros en resentirse. Un modelo pequeño que lee bien en inglés suele ser notablemente peor en vietnamita, amárico o criollo haitiano.
El tamaño le dice qué puede contener un modelo y dónde puede funcionar. No dice nada sobre si una respuesta en particular es cierta.
Modelos abiertos y modelos cerrados
Esta diferencia trata de quién tiene el modelo y si alguien fuera de la empresa puede ejecutarlo.
Nube cerrada y pesos abiertos
Su texto va a la empresa y regresa una respuesta. Suelen ser los modelos más fuertes y con más cobertura de idiomas. La empresa pone las condiciones, se queda con el modelo, y puede cambiarlo sin avisarle.
Usted descarga el modelo y lo ejecuta por su cuenta. El texto puede quedarse en la máquina. Cuesta hardware, instalación y tiempo del personal, y los modelos que realmente puede ejecutar son más pequeños y más débiles.
Los asistentes más conocidos son cerrados. La empresa se queda con los parámetros entrenados, y usted llega al modelo a través de su aplicación o de su interfaz de programación. Usted no puede inspeccionarlo, no puede ejecutarlo por su cuenta, y no puede conservarlo cuando la empresa lo cambia o lo retira. La empresa tampoco está obligada a decirle con qué se entrenó el modelo, qué tan grande es, o qué cambió en la última actualización, y casi nunca lo hace. Su texto viaja hasta los servidores de la empresa para obtener una respuesta.
Otras empresas publican los parámetros entrenados, así que cualquiera puede descargar el modelo y ejecutarlo en su propia computadora o en el servidor de su agencia. Por eso una laptop sin conexión a internet puede seguir respondiéndole, y por eso un proveedor pequeño puede construir un producto sin alquilarle un modelo a nadie.
Los pesos publicados son los números ya terminados. Los datos de entrenamiento (training data) y el código de entrenamiento que los produjeron suelen permanecer privados, así que nadie de afuera puede estudiar el modelo ni reconstruirlo, y la Open Source Initiative reserva el término código abierto para los modelos que publican lo suficiente para permitir eso (Open Source Initiative, 2024). Las licencias también varían. Algunos modelos de pesos abiertos tienen licencias permisivas estándar, y otros tienen condiciones propias que restringen quién puede usarlos y para qué. Lea la licencia antes de que su agencia construya algo sobre uno de ellos.
Un modelo que funciona en hardware que su agencia controla es el único arreglo en el que el texto del cliente nunca sale del edificio, y esa es una razón real para que le importen los pesos abiertos. También es fácil exagerar su alcance. Una aplicación puede construirse sobre un modelo abierto y aun así enviar cada palabra a un servidor en la nube. Pregunte adónde va el texto, y consiga la respuesta por escrito.
Abierto y cerrado no es una clasificación de calidad, ni de seguridad. Determina quién puede ejecutar el modelo y hasta dónde viaja su texto, y eso es antes que nada una pregunta sobre sus clientes, no sobre tecnología.
Los datos de entrenamiento y las fechas de corte
Dos modelos del mismo tamaño pueden comportarse de forma muy distinta. Un modelo está hecho del texto que vio y del ajuste (fine-tuning) que recibió después.
Estos modelos aprendieron de una cantidad enorme de texto tomado de internet, además de material con licencia y material comprado. La mayoría de los modelos cerrados nunca publica esa lista, así que usted no puede comprobar si el modelo vio algo bueno sobre la regla que está consultando. El texto de internet está dominado por el inglés y es escaso en la mayoría de los idiomas de sus clientes, y ahí empieza la brecha lingüística.
El entrenamiento se detiene en una fecha, y la memoria entrenada del modelo se detiene con él. Muchas herramientas ahora hacen una búsqueda en internet en vivo para llegar más allá de esa fecha, lo cual ayuda y a la vez cambia la pregunta. La respuesta entonces vale tanto como las páginas que la herramienta llegó a consultar, así que pregunte qué fuentes usó y ábralas.
Un dato que está al principio o al final de un texto largo se encuentra con mucha más fiabilidad que el mismo dato enterrado en el medio, y la precisión baja a medida que el texto se alarga (Liu et al., 2024). Pegue una política de cuarenta páginas, haga una pregunta puntual, y la respuesta puede pasar por alto un párrafo que el modelo técnicamente leyó. Cite el fragmento que le interesa en lugar de entregar todo el documento.
Una vez que un modelo puede predecir texto, se lo ajusta con retroalimentación humana para que siga instrucciones, responda con cierto tono y rechace ciertas solicitudes (Ouyang et al., 2022). Esa etapa, y no el tamaño, es la razón de que dos modelos se sientan distintos en una conversación. Esa etapa también premia estar de acuerdo. Los asistentes entrenados así tienden a alinearse con la opinión que expresa el usuario, y abandonan una respuesta correcta cuando el usuario insiste en lo contrario (Sharma et al., 2024). Dele al modelo una premisa equivocada y espere que construya sobre ella.
Los modelos se reentrenan y se actualizan, a veces sin aviso, y el mismo nombre en el menú puede corresponder a una maquinaria distinta a la del mes pasado. Vuelva a probar una instrucción guardada después de una actualización, junto con el juicio que se había formado sobre lo que esa herramienta hace bien.
El entrenamiento es la parte que usted no puede inspeccionar ni corregir, y determina cómo se comporta el modelo en vietnamita, en una regla del condado y en un cambio de política del mes pasado. Suponga que es escaso justo donde está su trabajo.
Qué modelo para qué tarea
- El nivel gratuito de una herramienta suele ser su modelo más liviano. Si la pregunta tiene consecuencias, revise qué modelo está usando.
- Un modelo etiquetado como razonamiento no es un modelo que verifica hechos.
- Dos productos pueden funcionar sobre el mismo modelo de base y aun así comportarse distinto, porque la empresa que lo envuelve le agrega sus propias instrucciones.
- Los puntajes de referencia (benchmarks) en un anuncio de lanzamiento se miden con tareas que no son las suyas, en un idioma que probablemente no es el de su cliente.
- Un modelo abierto no protege por sí solo los datos del cliente. Solo lo hace ejecutarlo en hardware que usted controla, y la mayoría de las aplicaciones construidas sobre modelos abiertos no lo hacen.
Averigüe qué modelo está usando
Tómense cinco minutos para que cada persona abra el menú de modelos en la herramienta de IA que realmente usa, y anote el nombre y la versión exactos. Ahora denle al grupo una pregunta que contenga una regla, algo con un límite de ingresos y un plazo. La mitad del grupo se la hace al modelo rápido, la otra mitad al modelo de razonamiento. Lean algunas respuestas en voz alta. La diferencia en el cuidado se nota, y también se nota que las dos igual necesitan verificarse.
Fuentes de esta página
- Ahia, O., Kumar, S., Gonen, H., Kasai, J., Mortensen, D. R., Smith, N. A., & Tsvetkov, Y. (2023). Do all languages cost the same? Tokenization in the era of commercial language models. Proceedings of EMNLP 2023, 9904-9923. https://doi.org/10.18653/v1/2023.emnlp-main.614
- Hinton, G., Vinyals, O., & Dean, J. (2015). Distilling the knowledge in a neural network. arXiv:1503.02531. https://arxiv.org/abs/1503.02531
- Hoffmann, J., Borgeaud, S., Mensch, A., et al. (2022). Training compute-optimal large language models. Advances in Neural Information Processing Systems 35. https://arxiv.org/abs/2203.15556
- Kaplan, J., McCandlish, S., Henighan, T., et al. (2020). Scaling laws for neural language models. arXiv:2001.08361. https://arxiv.org/abs/2001.08361
- Liu, N. F., Lin, K., Hewitt, J., Paranjape, A., Bevilacqua, M., Petroni, F., & Liang, P. (2024). Lost in the middle: How language models use long contexts. Transactions of the Association for Computational Linguistics, 12, 157-173. https://doi.org/10.1162/tacl_a_00638
- Open Source Initiative. (2024). The Open Source AI Definition 1.0. https://opensource.org/ai/open-source-ai-definition
- Ouyang, L., Wu, J., Jiang, X., et al. (2022). Training language models to follow instructions with human feedback. Advances in Neural Information Processing Systems 35. https://arxiv.org/abs/2203.02155
- Sharma, M., Tong, M., Korbak, T., et al. (2024). Towards understanding sycophancy in language models. International Conference on Learning Representations (ICLR) 2024. https://arxiv.org/abs/2310.13548
- Turpin, M., Michael, J., Perez, E., & Bowman, S. R. (2023). Language models don't always say what they think: Unfaithful explanations in chain-of-thought prompting. Advances in Neural Information Processing Systems 36. https://arxiv.org/abs/2305.04388
- Vaswani, A., Shazeer, N., Parmar, N., et al. (2017). Attention is all you need. Advances in Neural Information Processing Systems 30. https://arxiv.org/abs/1706.03762
- Wei, J., Wang, X., Schuurmans, D., et al. (2022). Chain-of-thought prompting elicits reasoning in large language models. Advances in Neural Information Processing Systems 35. https://arxiv.org/abs/2201.11903