Son las 21:15. Pegaste un síntoma en el chat y la respuesta llegó ordenada, con dosis y dos estudios. Suena a alguien que sabe. Cierras la pestaña más tranquilo de lo que estabas. Esa calma es el primer límite de la IA: convencer no es acertar. La pregunta de esta noche no es si te cayó bien. Es si la cita existe.
Qué hace por dentro cuando “responde”
Un modelo de lenguaje no abre un archivo de verdades. Calcula qué palabra sigue a la anterior, como el autocompletado del teléfono, a otra escala. Si la frase más probable es una cita que no existe, la escribe igual de fluida. Eso es una alucinación. El sesgo algorítmico entra por los textos con los que se entrenó: repite lo frecuente, no lo comprobado. Y no hay determinismo clínico: los mismos datos, en medicina, deben llevar a la misma conducta. La misma pregunta, en el chat, puede salir distinta al rato.
Tres números para no fiarte del tono
- Citas inventadas. En 42 revisiones cortas pedidas a chatbots comerciales de 2023, el 55 % de las referencias de una versión y el 18 % de la versión siguiente no existían. Entre las reales, muchas traían errores de fondo.
- Examen clínico. Un modelo afinado en conocimiento médico acertó el 67,6 % de preguntas tipo licencia de Estados Unidos. Falló una de cada tres.
- La misma pregunta, tres veces. Si cambian la dosis, la causa o el consejo, no hay una respuesta: hay un borrador.
na frase fluida no es una fuente. La supervisión humana empieza cuando pides la cita y la abres
Cómo preguntar sin soltar el criterio
La ingeniería de consulta sirve para acotar: pide la fuente, el año y qué no puede afirmar. La metacognición es darte cuenta de que te convenció el tono antes de mirar el enlace. Úsala para entender un término o armar preguntas. No para una dosis ni un diagnóstico. Si el síntoma es nuevo, no cede o asusta, la decisión no se cierra en el chat. En RedSana esa supervisión humana es el núcleo de la Medicina Integrativa: la máquina ordena, la persona comprueba.
1. Walters WH, Wilder EI. Fabrication and errors in the bibliographic citations generated by ChatGPT. Sci Rep. 2023;13:14045. doi:10.1038/s41598-023-41032-5. PMID: 37679503.
2. Singhal K, Azizi S, Tu T, et al. Large language models encode clinical knowledge. Nature. 2023;620(7972):172-180. doi:10.1038/s41586-023-06291-2. PMID: 37438534.
3. Ji Z, Lee N, Frieske R, et al. Survey of hallucination in natural language generation. ACM Comput Surv. 2023;55(12):1-38. doi:10.1145/3571730.
4. Alkaissi H, McFarlane SI. Artificial hallucinations in ChatGPT: implications in scientific writing. Cureus. 2023;15(2):e35179. doi:10.7759/cureus.35179. PMID: 36811129.