OpenAI heeft een taalmodel ontwikkeld dat specifiek is getraind voor biologie, genaamd GPT-Rosalind. Dit model is ontworpen om onderzoekers te helpen bij het navigeren door enorme datasets en gespecialiseerde vakliteratuur, wat een directe impact kan hebben op de snelheid van onderzoek en ontwikkeling in de life sciences.

Wat er aan de hand is

OpenAI heeft donderdag GPT-Rosalind aangekondigd, een groot taalmodel dat specifiek is getraind op biologische workflows. Volgens het bedrijf verschilt dit model van de meer generieke, wetenschapsgerichte modellen van andere grote techbedrijven. Yunyun Wang, Life Sciences Product Lead bij OpenAI, legde in een persbriefing uit dat het systeem is ontworpen om twee grote obstakels voor biologisch onderzoek aan te pakken. Ten eerste de enorme datasets die zijn ontstaan door decennia van genoomsequencing en eiwitbiochemie, die te omvangrijk kunnen zijn voor een individuele onderzoeker. Ten tweede de hoge mate van specialisatie binnen de biologie, waarbij elk subveld zijn eigen technieken en jargon kent. Het model is getraind op 50 van de meest voorkomende biologische workflows en op het toegang krijgen tot grote publieke databases met biologische informatie. Verder training heeft volgens OpenAI geleid tot een systeem dat waarschijnlijke biologische pathways kan suggereren en potentiële medicijndoelen kan prioriteren.

Wat dit betekent

Dit betekent een verschuiving van generieke AI-hulpmiddelen naar domeinspecifieke expertise. Voor Nederlandse biotech-startups, farmaceutische bedrijven (zoals Galapagos of Pharming) en onderzoeksinstellingen (zoals het Hubrecht Institute of het LUMC) kan dit de toegang tot gespecialiseerde kennis democratiseren. Een klein team of een startende onderzoeker krijgt hiermee in potentie een assistent die helpt de literatuur van een aangrenzend vakgebied te begrijpen, zoals een geneticus die zich moet verdiepen in neurowetenschappelijke papers. Het kan de doorlooptijd van vroeg onderzoek verkorten door het analyseren en synthetiseren van bestaande data te versnellen. Het is echter belangrijk te benadrukken dat dit, volgens de aankondiging, een tool blijft om onderzoek te ondersteunen en te versnellen, niet om menselijk oordeel en experimentele validatie te vervangen.

Hoe je dit kunt toepassen

De praktische toepassing hangt sterk af van jouw specifieke situatie binnen de life sciences-sector. Het model is aangekondigd als een gespecialiseerde onderzoeksassistent. Op basis van de beschreven functionaliteiten zijn dit mogelijke toepassingsscenario’s.

Als je een biotech-startup runt met een klein team, zou je kunnen onderzoeken of een tool als GPT-Rosalind je kan helpen bij het efficiënt screenen van wetenschappelijke literatuur buiten je directe expertise. Dit kan waardevol zijn bij het valideren van een nieuwe onderzoeksrichting of het identificeren van potentiële samenwerkingsgebieden zonder dat je direct een nieuwe specialist in dienst hoeft te nemen.

Als je in een farmaceutisch bedrijf werkt aan vroeg onderzoek, is een mogelijkheid om een dergelijk model te gebruiken voor het prioriteren van literatuurstudie rond potentiële medicijndoelen (drug targets). Het kan helpen bij het snel in kaart brengen van het bekende biologische pathway-netwerk rond een doelwit, wat de planning van experimenten kan informeren.

Als je een onderzoeksgroep leidt aan een universiteit of instituut, zou je kunnen overwegen hoe een domeinspecifiek taalmodel promovendi en postdocs kan ondersteunen bij het overbruggen van kenniskloven in interdisciplinair onderzoek. Het kan dienen als een eerste hulpmiddel om vertrouwd te raken met het jargon en de kernconcepten van een verwant vakgebied.

Als je betrokken bent bij onderzoeksfinanciering of venture capital in de life sciences, is het relevant om dit soort technologische ontwikkelingen te volgen. Het kan de efficiëntie en reikwijdte van due diligence veranderen, doordat teams complexe wetenschappelijke proposities sneller kunnen contextualiseren en vergelijken met de bestaande kennisbasis.

Bron: Arstechnica