OpenAI heeft een AI-model gelanceerd dat specifiek is getraind op biologische processen. Voor biotech-startups en MKB-labbedrijven betekent dit een mogelijke manier om onderzoekskosten te verlagen en doorlooptijden te verkorten, zonder dat je een groot data-team nodig hebt.

Wat er aan de hand is

Op donderdag kondigde OpenAI de beschikbaarheid aan van GPT-Rosalind, een groot taalmodel dat is getraind op vijftig veelvoorkomende biologische workflows. Het model is vernoemd naar Rosalind Franklin, de wetenschapper wiens werk cruciaal was voor de ontdekking van de DNA-structuur. Volgens Yunyun Wang, OpenAI’s Life Sciences Product Lead, is het systeem ontworpen om twee grote obstakels aan te pakken waar biologisch onderzoekers tegenaan lopen. Het eerste obstakel is de enorme hoeveelheid data uit decennia aan genoomsequencing en eiwitbiochemie, die te groot is voor één onderzoeker om te overzien. Het tweede is dat de biologie veel sterk gespecialiseerde deelgebieden kent, elk met eigen technieken en jargon. Een geneticus die werkt aan een gen dat actief is in hersencellen, kan bijvoorbeeld moeite hebben met de immense neurobiologische literatuur. Het model is verder getraind om toegang te krijgen tot grote openbare biologische databases en kan suggesties doen voor biologische routes en prioritering van mogelijke medicijndoelen.

Wat dit betekent

Voor Nederlandse biotech-startups en MKB-labbedrijven kan GPT-Rosalind een verschuiving betekenen in hoe je onderzoek doet. Waar je voorheen een team van specialisten nodig had om door gespecialiseerde literatuur te ploegen of om verbanden te leggen tussen genen en eiwitten, kun je nu een AI-model die analyse laten doen. Het model is niet alleen getraind op algemene wetenschap, maar specifiek op de workflows die in de biologie gebruikelijk zijn. Dat betekent dat het beter in staat is om de context van een vraag te begrijpen dan een generiek model. Voor kleinere bedrijven zonder eigen data-afdeling kan dit de drempel verlagen om complexe analyses uit te voeren. De impact is het grootst in sectoren zoals medicijnontwikkeling, diagnostiek en agrarische biotechnologie, waar het combineren van datasets uit verschillende bronnen vaak een knelpunt is.

Hoe je dit kunt toepassen

Als je een biotech-startup runt die zich richt op medicijnontwikkeling, kun je GPT-Rosalind inzetten om mogelijke medicijndoelen te prioriteren. Het model kan op basis van bestaande data uit openbare databases suggesties doen voor welke eiwitten of genen het meest veelbelovend zijn om verder te onderzoeken. Je zou kunnen overwegen om een pilot te starten waarbij je het model een aantal van je eigen onderzoeksvragen voorlegt en de uitkomsten vergelijkt met je huidige methoden. Een optie is om te beginnen met een klein aantal goed gedocumenteerde cases om te zien hoe accuraat de suggesties zijn.

Als je een MKB-lab runt dat diagnostische tests ontwikkelt, kun je GPT-Rosalind gebruiken om verbanden te leggen tussen genetische varianten en ziektes. Het model is getraind om genotype aan fenotype te koppelen via bekende routes en regulatiemechanismen. Overweeg om het model te vragen om een literatuuranalyse te doen voor een specifiek gen dat je onderzoekt. Het kan je wijzen op artikelen of databases die je nog niet kende, wat de doorlooptijd van je onderzoek kan verkorten.

Als je in de agrarische biotechnologie werkt, kun je het model inzetten om de functionele eigenschappen van eiwitten in planten te voorspellen. GPT-Rosalind kan op basis van sequentiegegevens suggesties doen voor welke eiwitten een rol kunnen spelen in resistentie tegen ziektes of droogte. Je zou kunnen experimenteren door het model een dataset van je eigen gewassen te laten analyseren en de uitkomsten te gebruiken als input voor je veredelingsprogramma. Een mogelijkheid is om het model te vragen om prioriteiten te stellen voor welke eiwitten je verder moet onderzoeken.

Als je een onderzoekssamenwerking hebt tussen verschillende disciplines, bijvoorbeeld genetica en neurobiologie, kan GPT-Rosalind helpen om de kloof tussen specialismen te overbruggen. Het model is getraind op meerdere deelgebieden en kan jargon uit het ene veld vertalen naar het andere. Overweeg om het model te gebruiken als een eerste interpretatie van literatuur uit een voor jou onbekend vakgebied. Het kan je een samenvatting geven van de belangrijkste concepten, zodat je sneller kunt bepalen of verdere samenwerking zinvol is.

Bron: Arstechnica