OpenAI heeft een taalmodel gelanceerd dat specifiek is getraind op biologische onderzoeksprocessen, genaamd GPT-Rosalind. Dit model is ontworpen om onderzoekers te helpen bij het navigeren door enorme datasets en het overbruggen van jargon tussen gespecialiseerde vakgebieden, wat kan leiden tot efficiënter onderzoek en snellere identificatie van mogelijke medicijndoelen.

Wat er aan de hand is

OpenAI heeft donderdag GPT-Rosalind aangekondigd, een groot taalmodel dat specifiek is afgestemd op veelvoorkomende workflows in de biologie. Het model is vernoemd naar de wetenschapper Rosalind Franklin. Volgens het bedrijf verschilt deze aanpak van de meer generieke, breed inzetbare wetenschapsmodellen die andere grote techbedrijven vaak aanbieden. In een persbriefing legde Yunyun Wang, Life Sciences Product Lead bij OpenAI, uit dat het systeem is ontworpen om twee grote knelpunten in het huidige biologisch onderzoek aan te pakken. Het eerste knelpunt is de enorme hoeveelheid data die is gegenereerd door decennia van genoomsequencing en eiwitbiochemie, wat te veel kan zijn voor een individuele onderzoeker om te overzien. Het tweede knelpunt is dat de biologie veel hooggespecialiseerde subdisciplines kent, elk met hun eigen technieken en jargon. Een geneticus die bijvoorbeeld werkt aan een gen dat actief is in hersencellen, kan moeite hebben met de omvangrijke neurobiologische literatuur. Het bedrijf heeft een LLM getraind op 50 van de meest voorkomende biologische workflows en op hoe de grote publieke databases met biologische informatie te doorzoeken. Verdere training heeft volgens OpenAI geresulteerd in een systeem dat waarschijnlijke biologische pathways kan suggereren en potentiële medicijndoelen kan prioriteren.

Wat dit betekent

De komst van een gespecialiseerd AI-model voor biologie markeert een verschuiving van generieke naar domeinspecifieke AI-tools. Voor Nederlandse MKB’ers in de gezondheidszorg, farmacie, agro-biotech of voedingsmiddelenindustrie betekent dit dat geavanceerde onderzoeksondersteuning toegankelijker wordt. Je hoeft niet langer een groot team van bio-informatici in huis te hebben om complexe datasets te analyseren of literatuur uit een aangrenzend vakgebied te doorgronden. Dit kan de doorlooptijd van onderzoeksprojecten verkorten en de kosten voor literatuuronderzoek en data-analyse verlagen. Voor startups in de life sciences kan het een gelijkmaker zijn, waardoor ze sneller hypotheses kunnen testen. Het model richt zich expliciet op het verbinden van genotype (genetische informatie) en fenotype (waarneembare eigenschappen), wat een kernproces is in veel toegepast onderzoek, van het ontwikkelen van gewasverbeteringen tot het begrijpen van ziekte-mechanismen.

Hoe je dit kunt toepassen

De praktische toepassing hangt sterk af van jouw specifieke situatie binnen de life sciences of aanverwante sectoren. Het model is primair een onderzoeksinstrument. Hier zijn enkele scenario’s waarin een tool als GPT-Rosalind van waarde zou kunnen zijn.

Als je een klein biotech-bedrijf runt en literatuuronderzoek doet… dan zou een gespecialiseerd model je kunnen helpen om sneller de kern te vinden van wetenschappelijke artikelen buiten je directe expertise. In plaats van weken te besteden aan het leren van neurobiologisch jargon voor een nieuw doelwit, kun je het model vragen de relevante bevindingen en methoden samen te vatten in begrijpelijke taal, waardoor je sneller kunt beslissen over de volgende onderzoeksstap.

Als je in de agro-biotech werkt aan gewasverbetering… dan zou je het model kunnen gebruiken om genetische data te koppelen aan bekende pathways voor droogte-resistentie of opbrengst. Het kan helpen bij het prioriteren van welke genvarianten het meest veelbelovend zijn voor verder labonderzoek, wat kostbare experimentele rondes kan besparen.

Als je een MKB’er bent in de voedingsmiddelenindustrie die onderzoek doet naar functionele ingrediënten… dan zou je het model kunnen bevragen over de biologische mechanismen achter bepaalde gezondheidsclaims. Het kan helpen bij het doorzoeken van databases naar eiwitstructuren of metabolische pathways die verband houden met een ingrediënt, wat je R&D-afdeling kan ondersteunen bij het opstellen van onderbouwde dossiers.

Als je samenwerkt met academische onderzoekers of onderzoeksinstituten… dan zou je kunnen overwegen om in toekomstige projectvoorstellen de inzet van dergelijke gespecialiseerde AI-tools op te nemen als methode voor data-integratie en literatuursynthese. Dit kan je voorstel innovatiever en efficiënter doen overkomen.

Overweeg wel dat dit een nieuwe tool is, en resultaten altijd kritisch en in de context van bestaande kennis moeten worden beoordeeld. Het vervangt niet de domeinexpertise van je team, maar kan het wel aanvullen.

Bron: Arstechnica