Comparación del rendimiento entre ChatGPT y estudiantes de Medicina en un examen real práctico con imágenes de Radiología y Medicina Física

Salvador, R.; Vas, D.; Oleaga, L.; Matute-González, M.; Castillo-Fortuño, À.; Setoain, X.; Nicolau, C.

doi:10.1016/j.rx.2024.09.002

ISSN: 0033-8338

Radiología, fundada en 1912, es el Órgano de Expresión Científica Oficial de la Sociedad Española de Radiología Médica (SERAM).
Radiología, de periodicidad bimestral (6 números al año), publica dos ediciones una en español y otra en inglés. Todos los artículos son sometidos a un riguroso proceso de revisión doble ciego Radiología focaliza su interés en la publicación de trabajos Originales, aunque también tienen cabida en ella Comunicaciones breves, Revisiones, Casos en imagen, Notas clínicas y Críticas de libros.
La revista está indexada entre otras en: Emerging Sources Citation Index (Clarivate), Medline, Scopus y EMBASE/Excerpta Médica.

Radiología ha recibido factor de impacto por primera vez en 2023 (FI 2022: 1,3), y en 2024 se le ha asignado cuartil en JCR (FI 2023: 1,1 [Q3]).

Guía para autores - Envío de manuscritos

Modelo de recertificación de las sociedades
científico-médicas de España

Indexada en:

Web of Science, Emerging Sources Citation Index (Clarivate), Medline, Scopus, Bibliomed, Biosis, Cab Health, Embase Alert, EMBASE/Excerpta Médica, Energy Science and Technology, IME, MEDES, Nuclear Science Abstracts, Scisearch, IBECS

Los modelos de inteligencia artificial ofrecen la capacidad de generar respuestas textuales a una amplia variedad de preguntas, incluidas aquellas relacionadas con temas médicos. Recientemente, han incorporado la posibilidad de interpretar y responder a consultas basadas en imágenes, incluyendo imágenes radiológicas. El objetivo principal del estudio es analizar el rendimiento de ChatGPT-4o frente a estudiantes de tercer año de Medicina en una prueba práctica de la asignatura de Radiología y Medicina Física. Como objetivo secundario pretendemos valorar la capacidad de ChatGPT para interpretar imágenes médicas y responder a preguntas sobre las mismas.

Material y métodos

Se examinó a un grupo de 33 estudiantes con 10 preguntas sobre imágenes radiológicas y de medicina nuclear. El mismo examen se administró a ChatGPT (versión GPT-4o) sin entrenamiento previo, siguiendo un formato idéntico. Las respuestas al examen fueron evaluadas por profesores que desconocían qué examen correspondía al modelo a prueba. Se utilizó la prueba U de Mann-Whitney para comparar los resultados entre los 2 grupos.

Resultados

Los estudiantes superaron a ChatGPT en 8 preguntas. La calificación media final de los estudiantes fue de 7,78 y la de ChatGPT fue de 6,05, situándose en el percentil 9 de la distribución de notas de los estudiantes.

Discusión

ChatGPT muestra un rendimiento competente en varias áreas, pero los estudiantes obtienen mejores calificaciones, especialmente en la interpretación de imágenes y en el razonamiento clínico contextualizado, donde la formación y la experiencia práctica de los estudiantes juegan un papel esencial. Son necesarias todavía mejoras en los modelos de inteligencia artificial para alcanzar la capacidad humana de interpretar imágenes radiológicas e integrar información clínica.

Palabras clave:

Inteligencia artificial

Educación médica

Estudiantes de Medicina

Radiología

Medicina nuclear

Radioterapia

Abstract

Introduction

Artificial intelligence models can provide textual answers to a wide range of questions, including medical questions. Recently, these models have incorporated the ability to interpret and answer image-based questions, and this includes radiological images. The main objective of this study is to analyse the performance of ChatGPT-4o compared to third-year medical students in a Radiology and Applied Physics in Medicine practical exam. We also intend to assess the capacity of ChatGPT to interpret medical images and answer related questions.

Materials and method

Thirty-three students set an exam of 10 questions on radiological and nuclear medicine images. Exactly the same exam in the same format was given to ChatGPT (version GPT-4o) without prior training. The exam responses were evaluated by professors who were unaware of which exam corresponded to which respondent type. The Mann-Whitney U test was used to compare the results of the 2 groups.

Results

The students outperformed ChatGPT on 8 questions. The students’ average final score was 7.78, while ChatGPT's was 6.05, placing it in the 9th percentile of the students’ grade distribution.

Discussion

ChatGPT demonstrates competent performance in several areas, but students achieve better grades, especially in the interpretation of images and contextualised clinical reasoning, where students’ training and practical experience play an essential role. Improvements in artificial intelligence models are still needed to achieve human-like capabilities in interpreting radiological images and integrating clinical information.

Keywords:

Artificial intelligence

Medical education

Medical students

Radiology

Nuclear medicine

Radiotherapy