Mario Rodríguez Mestre asegura que su equipo había identificado en 2022 el sistema molecular que Anthropic presentó como un descubrimiento de Claude y revela que había compartido con la IA su tesis, borradores, datos y materiales privados de investigación.
La promesa de que la inteligencia artificial puede convertirse en una nueva máquina de descubrimiento científico se enfrenta a una pregunta incómoda: ¿qué ocurre cuando una IA anuncia como hallazgo propio algo que un investigador ya había descubierto y había compartido previamente con esa misma herramienta? Es el interrogante que plantea el caso de Mario Rodríguez Mestre, biólogo computacional de la Universidad de Copenhague, después de que Anthropic presentara como uno de los primeros grandes éxitos científicos autónomos de Claude un sistema molecular que el investigador español asegura que su equipo había localizado y caracterizado años antes. La controversia no demuestra que Claude haya utilizado indebidamente los datos del científico, pero abre un debate mucho más profundo sobre privacidad, propiedad intelectual, atribución y trazabilidad del conocimiento en una ciencia cada vez más dependiente de modelos de inteligencia artificial.
La historia comenzó públicamente el 23 de septiembre, cuando Anthropic anunció la creación de un nuevo grupo de investigación y un laboratorio dedicado a las ciencias de la vida. La compañía aseguró que Claude había descubierto de manera prácticamente autónoma un sistema enzimático hasta entonces no caracterizado, asociado a unas largas secuencias repetitivas de ADN con una disposición que recuerda, estructuralmente, a CRISPR. Anthropic bautizó el sistema como ART, siglas de array-associated reverse transcriptases, y presentó el resultado como una demostración de que los modelos generales de IA pueden empezar a recorrer por sí mismos enormes bases de datos genómicos, detectar anomalías interesantes, formular hipótesis y señalar candidatos que posteriormente los científicos humanos pueden validar experimentalmente.
950 agentes, 21 horas y 210 millones de tokens
La dimensión computacional del experimento era espectacular. Según Anthropic, unos 950 agentes de Claude trabajaron durante aproximadamente 21 horas y consumieron 210 millones de tokens para explorar una enorme base de datos de secuencias genéticas. La compañía afirma que dio a los agentes una instrucción general para buscar ejemplos interesantes de transcriptasas inversas y que estos examinaron familias distintas, consultaron literatura científica, compararon estructuras y seleccionaron candidatos utilizando su propio criterio. Uno de ellos detectó finalmente una transcriptasa inversa situada junto a un gen asociado y una larga matriz de repeticiones de ADN regularmente espaciadas.
La comparación con CRISPR era inevitablemente poderosa desde el punto de vista científico y mediático. CRISPR también surgió de la observación de unas extrañas secuencias repetidas en microorganismos antes de que los investigadores comprendieran que formaban parte de un sistema inmunitario bacteriano y aprendieran a convertirlo en una herramienta programable de edición genética. Anthropic fue prudente al reconocer que todavía desconoce la función fundamental de ART y que hacen falta muchos más experimentos, pero presentó el descubrimiento como una primera demostración de que Claude puede identificar anomalías biológicas relevantes y dirigir análisis que inicien auténticos procesos de descubrimiento.
El problema apareció poco después: alguien ya conocía aquellas moléculas.
«El descubrimiento que hacen no es nada nuevo»
Mario Rodríguez Mestre sostiene que él y su equipo llevaban estudiando estos sistemas desde 2022. Según explicó a elDiario.es, las moléculas que Anthropic presenta como ART son retrones, sistemas basados en transcriptasas inversas capaces de sintetizar ADN a partir de ARN no codificante. El grupo de Rodríguez Mestre las había localizado en virus gigantes o jumbófagos y las había bautizado informalmente como «jumbotrones». Su arquitectura permite producir cantidades importantes de ADN y podría tener aplicaciones futuras, entre otras posibilidades, en edición genética múltiple.
La objeción del científico va más allá de una disputa terminológica. Según su relato, su equipo ya había identificado y caracterizado en 2022 las mismas secuencias y sus conjuntos asociados de ARN. El trabajo, sin embargo, todavía no había sido publicado en una revista científica ni depositado en un servidor de preprints. Esto convierte la coincidencia en particularmente delicada: si la información no estaba disponible públicamente, ¿cómo llegó Claude a un resultado tan parecido?
Aquí aparece el elemento que ha encendido las alarmas. Rodríguez Mestre utilizaba Claude intensamente en su trabajo científico. Según explica, el sistema tuvo acceso a su manuscrito de tesis, a borradores de artículos, a carpetas compartidas del laboratorio y a correos electrónicos con colaboradores. En palabras del investigador, Claude tenía acceso «prácticamente a todo».
Rodríguez Mestre no acusa a Anthropic de haber robado deliberadamente sus datos. Al contrario, reconoce expresamente que no dispone de pruebas para demostrar que Claude utilizara aquella información privada para llegar al supuesto descubrimiento. Pero considera que la coincidencia obliga a plantear esa posibilidad y, sobre todo, a discutir qué garantías reales tienen los científicos cuando entregan información inédita a sistemas propietarios.
Anthropic niega haber entrenado a Claude con esas conversaciones
La respuesta de Anthropic introduce un elemento fundamental. La compañía ha señalado que Claude no fue entrenado con las transcripciones privadas del investigador y que su equipo de biología molecular no tuvo acceso a esas conversaciones. También sostiene que no tenía conocimiento de ningún trabajo publicado que describiera previamente el sistema presentado como ART.
Eso deja abierta una posibilidad mucho menos inquietante pero científicamente perfectamente plausible: que Claude llegara de forma independiente a unas secuencias que Rodríguez Mestre ya había encontrado. Enormes bases de datos genómicos pueden ser examinadas por equipos diferentes y conducir a descubrimientos paralelos. La historia de la ciencia está llena de hallazgos simultáneos e independientes.
Pero precisamente porque el trabajo de Rodríguez Mestre no estaba publicado y porque el investigador había utilizado Claude para trabajar sobre él, demostrar esa independencia resulta mucho más complicado.
La cuestión ya no consiste únicamente en saber quién vio primero una determinada secuencia genética. El verdadero problema es la procedencia del conocimiento de una IA. Cuando un investigador humano publica un resultado, existe una cadena de atribución: autores, referencias, experimentos, fechas, cuadernos de laboratorio y publicaciones. Cuando un modelo produce una hipótesis después de procesar cantidades gigantescas de información, reconstruir el origen exacto de una idea puede resultar extraordinariamente difícil.
Dos hipótesis y las dos son problemáticas
Rodríguez Mestre plantea dos explicaciones posibles. La primera es que, de alguna manera, el material que había proporcionado a Claude influyera en el resultado. El propio científico admite que no puede demostrarlo y Anthropic lo niega. La segunda posibilidad es que investigadores de la compañía conocieran previamente este tipo de secuencias y que el experimento estuviera más orientado de lo que su presentación pública sugería.
Para Rodríguez Mestre, cualquiera de los dos escenarios merece discusión porque afecta directamente a cómo debe utilizar la comunidad científica los modelos propietarios. Si la IA puede incorporar información confidencial introducida por investigadores, existe un problema evidente de privacidad y apropiación intelectual. Si, en cambio, los experimentos están fuertemente guiados por conocimiento humano previo pero se presentan como descubrimientos autónomos de la IA, el problema pasa a ser de atribución y comunicación científica.
Anthropic describe una metodología distinta. Según su relato, la intervención humana se limitó esencialmente a proporcionar la pregunta inicial y posteriormente realizar las comprobaciones experimentales en laboratorio. Los agentes de Claude habrían recorrido los datos, investigado las familias de transcriptasas inversas y seleccionado autónomamente los candidatos.
La diferencia entre ambas versiones no es menor. Está en juego algo tan fundamental como determinar qué significa realmente que una inteligencia artificial haya realizado un descubrimiento científico.
El científico abandona Claude
Rodríguez Mestre ha extraído una conclusión práctica contundente. Ha anunciado que dejará de utilizar Claude para sus investigaciones y que está intentando trasladar su trabajo a modelos de código abierto. También recomienda a otros investigadores reconsiderar el uso de grandes modelos propietarios cuando trabajan con información todavía no publicada.
Su advertencia ha encontrado eco entre otros científicos. Toni Gabaldón, responsable del grupo de Genómica Comparada del IRB Barcelona, considera ingenuo asumir sin más que las grandes tecnológicas mantendrán una ética impecable en el tratamiento de información científica sensible. Ana Rojas, investigadora del CSIC y directora del grupo de Biología Computacional y Bioinformática, señala otra dificultad: los científicos se están haciendo progresivamente dependientes de herramientas cuyo funcionamiento interno y políticas de tratamiento de datos no pueden auditar directamente.
El problema se extiende además mucho más allá del investigador que introduce personalmente información en ChatGPT o Claude. Un científico puede decidir no compartir un manuscrito inédito con ninguna IA y descubrir posteriormente que un colaborador, un revisor, un editor o cualquier otra persona con acceso al documento sí lo ha hecho. En una investigación con decenas de participantes resulta prácticamente imposible controlar todas las vías por las que un dato confidencial puede acabar entrando en un sistema externo.
El nuevo «snoop-and-scoop» de la ciencia
El Financial Times ha situado el episodio dentro de un problema emergente que denomina «snoop-and-scoop»: sistemas de IA que podrían tener acceso, directa o indirectamente, a ideas científicas antes de su publicación y posteriormente participar en resultados que compiten con esas mismas investigaciones. No existe evidencia de que esto haya sucedido deliberadamente en el caso de Anthropic, pero la mera posibilidad obliga a reconsiderar las normas de confidencialidad científica.
El precedente resulta especialmente delicado porque los modelos de IA están entrando en todas las etapas de la investigación: búsqueda bibliográfica, programación, análisis estadístico, interpretación de datos, redacción de manuscritos, generación de hipótesis y diseño experimental. Cuanto más útiles se vuelven, más información inédita reciben.
Y cuanto más información reciben, más importante resulta conocer qué ocurre con ella.
El caso también llega después de otra controversia sobre la atribución de descubrimientos matemáticos relacionados con el problema de Navier-Stokes, en la que se discutió hasta qué punto sistemas de inteligencia artificial podían estar aprovechando ideas humanas todavía no plenamente reconocidas. Los episodios son distintos y no existe evidencia de una práctica sistemática, pero ambos apuntan hacia la misma zona gris: la ciencia no dispone todavía de reglas preparadas para establecer la procedencia de una idea cuando humanos y modelos trabajan continuamente sobre los mismos problemas.
La IA puede acelerar la ciencia, pero ¿de quién será el descubrimiento?
La paradoja es que el episodio no reduce necesariamente la importancia de la inteligencia artificial para la ciencia. Incluso si Rodríguez Mestre hubiera descubierto antes el sistema, que centenares de agentes puedan rastrear gigantescas bases genómicas en apenas unas horas y detectar de manera independiente una estructura biológicamente interesante seguiría siendo una demostración poderosa de lo que estas herramientas pueden aportar.
Pero también cambiaría la naturaleza del logro.
No sería exactamente la historia de una IA descubriendo algo que ningún humano había visto. Sería la historia de una IA capaz de reproducir rápidamente un hallazgo al que un grupo de investigadores había llegado después de años de trabajo. Esa capacidad también sería extraordinaria, pero es científicamente distinta y exige una comunicación mucho más precisa.
La controversia ART muestra por ello un problema que crecerá conforme los modelos se vuelvan mejores científicos. La cuestión ya no será simplemente si una IA puede formular una hipótesis, escribir código o interpretar un experimento. Habrá que poder reconstruir de dónde procede cada descubrimiento, qué información utilizó el sistema, quién aportó las ideas fundamentales y quién merece el crédito.
La ciencia moderna ha construido durante siglos mecanismos para responder a esas preguntas entre seres humanos: citas, autorías, patentes, revisión por pares, cuadernos de laboratorio y fechas de publicación. La inteligencia artificial está desdibujando esas fronteras a una velocidad para la que esas instituciones no estaban preparadas.
El caso de Mario Rodríguez Mestre no demuestra que Claude le robara una idea. Pero sí demuestra algo quizá más importante: cuando una inteligencia artificial puede trabajar sobre millones de artículos públicos mientras simultáneamente ayuda a científicos con investigaciones privadas, la trazabilidad deja de ser un detalle técnico y se convierte en una condición esencial de la confianza científica.
Si las compañías quieren presentar a sus modelos como descubridores, tendrán que demostrar no solo que sus sistemas encuentran cosas nuevas. También tendrán que demostrar de dónde no las han sacado.