D’Epstein a Ceuta: quan la IA permet investigar millor

Diferents casos d’èxit mostren com la intel·ligència artificial generativa és molt útil en les investigacions periodístiques

 

El cas del financer Jeffrey Epstein ha estat investigat amb IA pel New York Times.

La IA generativa ja forma part de les redaccions periodístiques. Pràcticament totes la fan servir. Un 89,9% dels periodistes consideren, a més, que aquesta tecnologia permet estalviar temps, segons un estudi recent del grup de treball d’IA del Col·legi de Periodistes. Però, i si la IA fos també l’eina per a arribar a històries que abans eren inabastables?

Cinc usos en el cas dels arxius Epstein

Teresa Mondría Terol, experta en IA aplicada a la comunicació, va explicar a la Media Party Barcelona –la conferència internacional d’innovació en mitjans i periodisme que va celebrar-se a inicis de setembre al CaixaForum– com van fer servir aquestes noves tecnologies en la investigació dels arxius Epstein a The New York Times. D’entrada, cal assenyalar el repte sobrehumà en què es trobava la redacció, donat el volum de dades. «Si imprimíssim tots els documents, la pila seria tan gran com l’Empire State», va comparar Mondría. El primer de tot era veure si la IA podia facilitar la tasca de «separar les agulles de la palla».

Segons va explicar, la incorporació de l’IA a la redacció ha de tenir en compte quines històries es poden perseguir quan el temps no és un límit i, d’altra banda, ha de copsar en quins casos «els processos de verificació no suposaran un problema després».

Sobre el cas dels arxius Epstein, Mondría va assenyalar usos de la IA. Per exemple, van descobrir que Jeffrey Epstein i Steve Bannon a vegades interactuaven amb el sobrenom de «JD» i «SD», el que va permetre reconstruir millor les seves converses i traçar correlacions. A partir d’aquesta troballa, recorda Mondría, es van poder aïllar tots els documents que els relacionaven «per a poder reconstruir la línia de temps i publicar la peça que descrivia la relació entre aquestes dues persones».

Una qüestió no menys important en la investigació era endreçar temporalment les interaccions i amb ajuda de l’IA van extreure les dades temporals en documents que «no tenien el mateix format visual». Després, això sí, aquestes s’havien de verificar individualment.

La IA també els va permetre crear un cercador d’imatges, ja que entre la infinitat de dades, hi havia moltes proves visuals. Per fer-ho més senzill, van generar descripcions textuals de les imatges per crear un cercador semàntic. A més, amb xats intel·ligents van generar una base de dades amb què van alimentar un agent d’IA per interaccionar en llenguatge natural. Així van poder «parlar amb els documents» per obtenir cites i atribucions concretes. Finalment, va ser també molt útil en les transcripcions de vídeos i àudios perquè la IA els va permetre transformar massivament arxius que, altrament, s’haurien de consultar individualment. Malgrat tot això, segons va advertir Mondría, cal avaluar qualsevol ús d’IA. «Els models no són deterministes», va concloure.

Des de TVE s’ha investigat amb IA els missatges sobre l’entrada dels migrants a Ceuta. Foto: RTVE.

Investigar la desinformació a la crisi de Ceuta

Montserrat Rigall és periodista de VerificaRTVE i ha treballat en la investigació dels grups de WhatsApp i comunitats de Facebook on s’organitzen les entrades a Ceuta després del primer episodi del 30 i 31 de juliol. En aquest cas, la IA ha permès salvar la barrera lingüística i, a més, analitzar més de 12.000 interaccions.

“Sense la IA no hauríem pogut arribar a obtenir resultats, perquè l’allau de missatges de WhatsApp, en un moment en què els migrants s’estaven organitzant per entrar de forma massiva a Ceuta, era ingent”, explica Rigall, doctoranda en IA aplicada a la comunicació.

D’entrada, apunta Rigall, la majoria d’interaccions eren en dàrija [àrab marroquí]. A més, en les converses hi havia text, àudio, vídeo i fins i tot enquestes per a decidir el dia i la modalitat d’entrada al país. Per això, l’eina que van desenvolupar havia de permetre traduir i convertir tots aquests formats en dades sistematitzades per a poder obtenir conclusions.

Rigall va desenvolupar aquesta plataforma amb ChatGPT i Claude i es tracta d’una interfície de codi informàtic connectada a una Interfície de Programació d’Aplicacions (API). Aquesta experta exportava les converses dels grups cada dia i les introduïa directament a l’eina, que analitzava els missatges i detectava els patrons: possibles dates d’entrada a Espanya (amb un percentatge de fiabilitat) i fins i tot les narratives o arguments que feien servir els integrants dels grups. Després, la interfície permetia anar a missatges concrets i comprovar-ne el contingut un a un. “Si la sabem utilitzar bé, la IA ens pot permetre investigar coses que d’altra manera no podíem investigar”, conclou.

Com començar de zero?

Actualment, existeixen infinitat d’eines de codi obert que s’estan compartint per tal de facilitar aquestes tasques d’investigació. Mondría va compartir en la ponència un plug-in desenvolupat per ProPublica que permet inferir patrons en fulls de càlcul. En aquesta línia, Hugging Face és el repositori de models de codi obert més important del món: allà és on els desenvolupadors comparteixen coneixement.

En altres casos, caldrà desenvolupar eines ad hoc per executar en local a l’ordinador (en cas de treballar amb dades sensibles) o connectades a una API externa (servei d’IA). Amb aquest propòsit, poden ser útils plataformes com Cursor o Antigravity, de Google, per tal de programar-ho. Mitjançant llenguatge natural, i amb pocs coneixements de codi, es poden arribar a crear eines personalitzades i adaptades a cada cas, com l’agent creat per Rigall.

També és útil conèixer diferents serveis amb API disponible. Per les transcripcions d’àudio i vídeo hi ha Whisper (OpenAI), que és de codi obert. També hi ha Parakeet (Nvidia). I per l’anàlisi de documents i text (LLM, reconeixement d’imatges i documents) es pot utilitzar Claude, Google Gemini, OpenAI i Mistral.

Comparteix la notícia