BETA Este sitio está en versión beta. Seguimos añadiendo y revisando la información.
Lo que realmente puede hacer con la IA
10

Analice y visualice los datos de su programa

La IA puede acelerar el trabajo ordinario con datos: limpiar una hoja de cálculo desordenada, resumir una encuesta, redactar un gráfico, o escribir una fórmula. Es rápida para la preparación y funciona a partir de cifras agregadas y desidentificadas que usted pega. No es una calculadora en la que pueda confiar, así que los números y lo que significan siguen siendo suyos.

El flujo de trabajo

Prepare rápido, y luego verifique

PrepararLimpiar y reestructurar los datos
AnalizarResumir, agrupar, redactar una fórmula
VisualizarRedactar un gráfico y su descripción
VerificarRecalcule usted mismo los números clave
Todo número en el que se apoya una decisión se recalcula contra la fuente.
La IA es más rápida para preparar y redactar. El último paso, verificar la aritmética y el significado, es suyo.
  • Es buena para la preparación: limpiar y reestructurar una hoja de cálculo, sugerir un tipo de gráfico, escribir una fórmula de hoja de cálculo o de código, y redactar la historia en lenguaje sencillo de un resultado.
  • Pídale que escriba y ejecute código para cualquier cálculo, y aun así recalcule contra la fuente los números en los que se apoya una decisión.
  • Es más débil al elegir el método y al hablar de causalidad. Ejecutará con confianza una estadística que no se ajusta a sus datos, y es menos confiable cuando se le pregunta si una cosa causó otra.
  • Un gráfico puede engañar. Un gráfico redactado por IA puede usar un eje recortado, una codificación equivocada, o colores que fallan para lectores daltónicos, y los modelos son malos para notar cuándo un gráfico engaña.
  • Solo datos agregados y desidentificados. Nunca pegue una lista de clientes ni nada que identifique a una persona en una herramienta general.
  • La interpretación le pertenece a usted. Lo que un número significa para su programa y sus clientes es un juicio que hace una persona.

Cómo funciona, y dónde falla

Hacer los cálculos "de memoria" no es confiable; ejecutar código es mejor

Cuando usted pega números en un chat corriente y pide un promedio o un total, el modelo no calcula. Predice cómo debería verse una respuesta escrita, y de ahí vienen los errores silenciosos de aritmética y de redondeo. Hacer que el modelo, en cambio, escriba código que un intérprete real ejecuta sobre los datos elevó la exactitud en unos doce puntos frente al razonamiento escrito, en un conjunto de pruebas de matemáticas y finanzas, porque la computadora hace la aritmética (Chen y colegas, 2023). El código corrige la aritmética; no corrige la elección del método. En un amplio banco de pruebas de estadística, el mejor modelo alcanzó solo alrededor del sesenta y cinco por ciento, y sus errores fueron sobre todo aplicar un método que no se ajustaba a los datos, un error que una persona ocupada difícilmente detectaría (Zhu y colegas, 2024).

Aunque el código se ejecute, aproximadamente uno de cada cinco números puede seguir estando mal

En un banco de pruebas que permitía a los modelos usar un intérprete de código en tareas reales de análisis de datos, el código se ejecutó casi siempre, pero solo alrededor del setenta y ocho por ciento de las respuestas calculadas fueron correctas, y solo alrededor del sesenta y cuatro por ciento de los gráficos fueron correctos (Zhang y colegas, 2024). Que el código se ejecute no es lo mismo que la respuesta sea correcta, porque el modelo puede escribir código que lee la columna equivocada, filtra las filas equivocadas, o elige el método equivocado. El problema crece con el tamaño de la tabla: la exactitud en cálculos simples sobre una tabla pegada cayó bruscamente conforme la tabla se alargaba, y las filas duplicadas por sí solas dañaron gravemente los totales de un modelo (Wolff y Hulsebos, 2025). La causalidad es el área más débil de todas; en un banco de pruebas de razonamiento con datos, los modelos manejaron las preguntas estadísticas mucho mejor que las causales, que se ubicaron por debajo de la mitad (Liu y colegas, 2024).

Un gráfico que se ve impecable puede seguir estando equivocado, y el color es el punto ciego

Un gráfico puede renderizarse sin error y aun así codificar los datos de forma incorrecta. En un banco de pruebas de visualización, el mejor modelo produjo un gráfico válido y correcto alrededor de tres cuartas partes de las veces, y aproximadamente uno de cada cinco gráficos se ejecutó pero distorsionó los datos de alguna manera, como un eje equivocado, una asignación equivocada, o una leyenda faltante (Chen y colegas, 2024). Pedirle al modelo que detecte un gráfico engañoso ayuda solo moderadamente y depende mucho de la instrucción, y los modelos son más débiles para detectar problemas de color (Lo y Qu, 2024). La solución que hay que pedir por su nombre es una paleta apta para personas daltónicas; el conjunto Okabe-Ito, ampliamente usado, se mantiene distinguible para aproximadamente uno de cada doce hombres con una deficiencia de visión del color (Wong, 2011).

Obtenga un número en el que pueda confiar
Cómo realizar una tarea de datos que pueda verificar
  1. Elimine nombres, fechas de nacimiento, direcciones y números de caso antes de subir cualquier cosa.
  2. Pídale que escriba y ejecute código para cada cálculo, y que le muestre el código.
  3. Para un gráfico, pida un eje que comience en cero, etiquetas directas, y la paleta apta para daltónicos Okabe-Ito.
  4. Recalcule usted mismo los números clave, o verifíquelos en una hoja de cálculo, antes de que entren en un informe.
  5. Mantenga la interpretación, y cualquier afirmación de que una cosa causó otra, en manos de una persona.
Una hoja de cálculo de admisión desordenada Una tabla limpia que usted puede verificar
Limpie y estandarice una hoja de cálculo desidentificada

Escriba y ejecute Python para estandarizar las columnas de esta hoja de cálculo desidentificada: haga consistentes las etiquetas de categoría, ponga las fechas en un solo formato, y marque las filas en blanco o duplicadas. Muéstreme el código, el número de filas antes y después, y los conteos de valores de cada columna para que yo pueda confirmar que no se perdió nada. [suba una exportación desidentificada, sin nombres ni números de caso]

Regla de seguridad. Confirme que el número de filas no cambió y que las categorías son correctas, ya que la limpieza puede eliminar o fusionar filas en silencio. Consulte el Módulo 4.

Una exportación desidentificada de encuesta Un resumen con los conteos mostrados
Resuma una encuesta de satisfacción de clientes

Usando código, calcule el conteo y el porcentaje de cada opción de respuesta en cada ítem de esta encuesta desidentificada, y la media de los ítems de calificación. Muestre la distribución completa, no solo el promedio, e imprima el código. No ejecute ninguna prueba de significancia a menos que yo lo pida. [suba las respuestas desidentificadas, elimine primero cualquier columna de texto abierto]

Regla de seguridad. Vuelva a sumar a mano los conteos de un ítem para verificar el total, y desconfíe de cualquier prueba que la herramienta proponga, ya que los modelos a menudo eligen un método que no se ajusta. Consulte el Módulo 2.

Una pequeña tabla agregada Un gráfico y una descripción listos para la junta directiva
Redacte un gráfico y una descripción sencilla para un informe

Haga un gráfico de barras a partir de esta tabla agregada usando código. Comience el eje y en cero, etiquete las barras directamente, y use la paleta apta para daltónicos Okabe-Ito. Luego escriba una descripción de dos oraciones que indique únicamente lo que el gráfico muestra, sin ninguna afirmación sobre causalidad. [pegue los conteos agregados, sin filas a nivel de cliente]

Regla de seguridad. Verifique que el eje no esté recortado y que las etiquetas coincidan con los números, y lea la descripción para que no exagere una tendencia. Consulte el Módulo 2.

Ejemplo práctico

Un total que no cuadra

  1. Usted pega una columna de conteos mensuales de admisión y pide, en un chat corriente, el total anual y el cambio porcentual.
  2. La respuesta da un total limpio y un porcentaje, formateado y con aire de seguridad.
  3. Usted suma la columna por su cuenta y encuentra que el total está mal por un mes que el modelo omitió, y que el porcentaje usó la base equivocada.
  4. Le pide de nuevo que escriba y ejecute el código, verifica el resultado contra su propia suma, y solo entonces pone el número en el informe. El formato se veía terminado; la aritmética no lo estaba.

Regla de seguridad. Use solo datos agregados y desidentificados, y trate cada número como un borrador. Recalcule contra la fuente los que importan. Consulte el Módulo 2 y el Módulo 4. Para convertir un resultado en un gráfico y una descripción para un informe, consulte Storytelling.

Fuentes
  1. Chen, W., Ma, X., Wang, X., & Cohen, W. W. (2023). Program of thoughts prompting: Disentangling computation from reasoning for numerical reasoning tasks. Transactions on Machine Learning Research. https://arxiv.org/abs/2211.12588
  2. Zhu, Y., Du, S., Li, B., Luo, Y., & Tang, N. (2024). Are large language models good statisticians? In Advances in Neural Information Processing Systems 37 (Datasets and Benchmarks Track). https://arxiv.org/abs/2406.07815
  3. Liu, X., Wu, Z., Wu, X., Lu, P., Chang, K.-W., & Feng, Y. (2024). Are LLMs capable of data-based statistical and causal reasoning? Benchmarking advanced quantitative reasoning with data. In Findings of the Association for Computational Linguistics: ACL 2024. https://arxiv.org/abs/2402.17644
  4. Zhang, S., Zhang, C., Hu, Y., Shen, H., Liu, K., Ma, Z., et al. (2024). CIBench: Evaluating your LLMs with a code interpreter plugin. arXiv. https://arxiv.org/abs/2407.10499
  5. Chen, N., Zhang, Y., Xu, J., Ren, K., & Yang, Y. (2024). VisEval: A benchmark for data visualization in the era of large language models. IEEE Transactions on Visualization and Computer Graphics. https://arxiv.org/abs/2407.00981
  6. Lo, L. Y.-H., & Qu, H. (2024). How good (or bad) are LLMs at detecting misleading visualizations? IEEE Transactions on Visualization and Computer Graphics. https://arxiv.org/abs/2407.17291
  7. Wong, B. (2011). Points of view: Color blindness. Nature Methods, 8(6), 441. https://doi.org/10.1038/nmeth.1618