OpenAI heeft een nieuw groot taalmodel gelanceerd dat specifiek is getraind op biologische workflows, genaamd GPT-Rosalind. Dit model is ontworpen om onderzoekers in de levenswetenschappen te helpen bij het navigeren door enorme datasets en gespecialiseerde literatuur, wat de innovatiesnelheid in sectoren zoals farmacie, biotechnologie en voedingsmiddelen kan verhogen.

Wat er aan de hand is

OpenAI kondigde op donderdag de ontwikkeling aan van GPT-Rosalind, een groot taalmodel (LLM) dat specifiek is afgestemd op biologie. Volgens het bedrijf verschilt dit model van de meer generieke, wetenschapsbrede modellen van andere grote techbedrijven. Yunyun Wang, Life Sciences Product Lead bij OpenAI, legde in een persbriefing uit dat het systeem is ontworpen om twee grote obstakels voor huidige biologisch onderzoekers aan te pakken. Het eerste is de omvang van de datasets die zijn ontstaan door decennia van genoomsequencing en eiwitbiochemie, die te groot kunnen zijn voor een individuele onderzoeker. Het tweede is de fragmentatie van de biologie in vele, zeer gespecialiseerde subdisciplines, elk met eigen technieken en jargon. Het model is getraind op 50 van de meest voorkomende biologische workflows en op het toegang krijgen tot grote publieke databases met biologische informatie. Verder training heeft volgens OpenAI geresulteerd in een systeem dat waarschijnlijke biologische pathways kan suggereren en potentiële medicijndoelen kan prioriteren.

Wat dit betekent

De komst van een domeinspecifieke AI voor biologie betekent een verschuiving van generieke onderzoeksassistenten naar gespecialiseerde tools. Voor Nederlandse bedrijven en kennisinstellingen in de levenswetenschappen – van farmaceutische bedrijven en biotech-startups tot voedingsmiddelenproducenten en academische onderzoeksgroepen – kan dit de toegang tot complexe biologische kennis democratiseren. Een onderzoeker in een klein team of een MKB-bedrijf krijgt hiermee in theorie een krachtige tool om door gespecialiseerde literatuur te navigeren en verbanden te leggen tussen datasets die voorheen het domein waren van grote, goed gefinancierde onderzoeksafdelingen. Het kan de tijd tussen een onderzoeksvraag en een geïnformeerde hypothese verkorten. Het model richt zich specifiek op het verbinden van genotype (genetische informatie) met fenotype (waarneembare eigenschappen) via bekende pathways, wat de kern vormt van veel onderzoek naar nieuwe medicijnen, gewassen of industriële enzymen.

Hoe je dit kunt toepassen

De praktische toepassing hangt sterk af van de specifieke situatie en de uiteindelijke beschikbaarheid en mogelijkheden van het model. Op basis van de aankondiging van OpenAI zijn dit mogelijke scenario’s:

Als je in een farmaceutisch of biotech MKB werkt… Je bent constant op zoek naar nieuwe doelwitten voor medicijnen of biologische producten. Een tool als GPT-Rosalind zou je kunnen helpen bij het screenen van wetenschappelijke literatuur naar genen of eiwitten die betrokken zijn bij een bepaalde ziekte. Het zou op basis van bekende pathways nieuwe, plausibele aangrijpingspunten kunnen prioriteren, waardoor je je experimentele resources gerichter kunt inzetten.

Als je onderzoek doet aan een universiteit of hogeschool… Je werkt vaak op het snijvlak van disciplines, bijvoorbeeld tussen genetica en neurowetenschappen. De gespecialiseerde jargonbarrière tussen velden kan vertragend werken. Een domeinspecifiek model dat getraind is op deze workflows zou kunnen fungeren als een vertaler en gids, waardoor je sneller de relevante literatuur en technieken uit een aangrenzend vakgebied kunt begrijpen en toepassen.

Als je innovatie leidt in de voedingsmiddelen- of agrisector… Je zoekt naar manieren om gewaseigenschappen te verbeteren of nieuwe functionele ingrediënten te ontwikkelen. Een AI die getraind is op biologische pathways kan helpen bij het analyseren van welke genen betrokken zijn bij gewenste eigenschappen zoals droogtetolerantie of voedingswaarde. Dit kan het veredelingsproces informeren en versnellen door gerichtere keuzes mogelijk te maken.

Als je een startup runt rondom persoonlijke voeding of gezondheid… De belofte van gepersonaliseerde adviezen gebaseerd op genetica stuit vaak op complexe biologische interpretaties. Een gespecialiseerd model zou kunnen helpen bij het interpreteren van klant-specifieke genetische data in de context van wetenschappelijke literatuur over voeding en metabolisme, om zo beter onderbouwde suggesties te genereren. Het is belangrijk om te benadrukken dat dit model een ondersteunende tool is voor onderzoek en analyse, en geen vervanging voor klinische trials of gedegen wetenschappelijk werk.

Bron: Arstechnica