Citas falsas de ChatGPT: por qué la IA inventa referencias y cómo evitarlo
ChatGPT y otros modelos de lenguaje generan a menudo referencias que parecen reales y no existen. Por qué ocurre, cómo detectarlas y qué orden de trabajo hace más segura una revisión de literatura.
Si le pide a ChatGPT una revisión de literatura, devolverá párrafos fluidos y citas seguras: autores, años, revistas, incluso DOI. El problema es que una parte importante de esas referencias no existe.
No es un fallo ocasional. Los estudios que auditan bibliografías generadas por modelos encuentran referencias inventadas una y otra vez. Un estudio de 2023 publicado en Cureus halló que alrededor del 47 % de las referencias generadas por GPT-3.5 eran inventadas por completo, y que muchas de las que sí existían contenían errores. Los modelos posteriores mejoraron, pero el problema no desapareció. GPT-4 sigue inventando o atribuyendo mal una fracción relevante de citas en tareas académicas.
Para un estudiante de posgrado o un investigador, una cita inventada en un manuscrito enviado cuesta más que el tiempo que ahorró la IA.
Por qué los modelos inventan citas
Un modelo de lenguaje no es una base de datos. Predice el siguiente fragmento de texto plausible. Tres propiedades hacen casi inevitable la alucinación de citas en un chat sin más.
1. La cita se genera, no se recupera
Cuando ChatGPT escribe «(Smith et al., 2021)», no está consultando nada. Está generando un texto que se parece, en términos estadísticos, a las citas de sus datos de entrenamiento. El nombre, la revista y el año van juntos porque parecen encajar, no porque exista ese artículo.
2. El objetivo del entrenamiento es parecer verdadero, no serlo
Una referencia inventada como «Machine learning approaches for early sepsis detection: a systematic review. Journal of Clinical Medicine, 2022» es una cadena perfectamente plausible. El modelo cumplió su tarea aunque el artículo no exista. La veracidad no era lo que se optimizaba.
3. La seguridad no transporta incertidumbre
Las citas inventadas salen con la misma fluidez que las reales. Dentro del modelo no hay una señal que separe «esto lo recuperé» de «esto lo inventé». Esa carga cae entera en quien lee.
Cómo detectar citas falsas
Antes de que una cita escrita por IA entre en el manuscrito:
- Busque el título exacto en Google Scholar, PubMed o Semantic Scholar. Si una búsqueda por el título completo no da resultado, es una señal de alarma.
- Resuelva el DOI. Péguelo en doi.org. Un DOI inventado no resuelve o apunta a otro artículo.
- Mire si el autor y la revista casan. Las alucinaciones suelen juntar autores reales con revistas en las que nunca publicaron.
- Verifique la afirmación, no solo la existencia. Citar un artículo real por algo que nunca dijo es más difícil de ver, y más dañino, que citar uno que no existe.
El control a mano funciona. No escala. Revisar 40 referencias una por una lleva horas y se come el tiempo ahorrado.
Un orden más seguro: primero recuperar, después escribir
La corrección de fondo invierte el tubo. No es «generar texto y esperar que las citas sean reales», sino «recuperar artículos reales y escribir solo a partir de ellos».
| Flujo | Origen de la cita | Riesgo de alucinación |
|---|---|---|
| Chatbot (ChatGPT y otros) | generado desde los datos de entrenamiento | alto |
| Chatbot con búsqueda web | recuperación y generación mezcladas | medio |
| Herramienta de revisión que recupera primero | artículos de bases académicas | bajo; el respaldo de la afirmación hay que comprobarlo aparte |
El orden queda así:
- Busque en bases reales. Parta de la pregunta y recupere artículos de índices académicos.
- Criba antes de escribir. Revise la relevancia y elija lo que debe sostener el borrador.
- Genere solo desde lo elegido. El borrador solo puede citar ese conjunto. Una referencia inventada es imposible por construcción.
- Audite el respaldo de cada afirmación. Aunque la cita exista, compruebe antes de exportar que el artículo dice eso.
Ese es el orden de la auditoría de citas de LitSynth: recuperar artículos, elegir la evidencia, generar un borrador citado solo con esa selección y marcar las afirmaciones con apoyo débil antes de exportar. El recorrido completo está en el flujo de revisión de literatura.
Preguntas frecuentes
¿ChatGPT siempre inventa las citas? No. Sobre todo en artículos muy citados, algunas referencias son reales. El problema es que, sin revisar cada una, no se sabe cuáles.
¿Modelos más nuevos, como GPT-4, hacen seguras las citas? Más seguras, no seguras. La tasa de invención bajó bastante respecto de GPT-3.5, pero las auditorías siguen encontrando referencias inventadas o mal atribuidas. Para un envío académico, «a veces inventa» no es aceptable.
¿Se puede usar ChatGPT en una revisión de literatura? Sí: para proponer términos de búsqueda, resumir artículos que usted mismo aporta y reordenar sus propios borradores. La zona peligrosa es dejar que produzca citas de la nada. La generación tiene que quedar anclada a artículos que usted recuperó.
¿Cuál es la forma más rápida de verificar referencias generadas por IA? La búsqueda por título exacto en Google Scholar más la resolución del DOI atrapa la mayoría de las invenciones. Para verificar afirmaciones en volumen hace falta una herramienta con auditoría de citas.
Conclusión
Las citas falsas no son un fallo que vaya a parchearse. Son una propiedad de los flujos que generan primero. La corrección es de arquitectura: recuperar artículos reales, escribir solo desde lo elegido y auditar el respaldo de las afirmaciones antes de exportar. Una revisión de literatura solo se puede auditar si se puede seguir hasta la fuente.