OpenAI heeft een groot taalmodel gelanceerd dat specifiek is getraind op biologische onderzoeksprocessen, genaamd GPT-Rosalind. Dit model is ontworpen om onderzoekers te helpen bij het verwerken van enorme datasets en het overbruggen van kennis tussen gespecialiseerde vakgebieden, wat de innovatiesnelheid in de life sciences kan verhogen.

Wat er aan de hand is

OpenAI heeft donderdag GPT-Rosalind aangekondigd, een groot taalmodel (LLM) dat specifiek is getraind op vijftig van de meest voorkomende biologische workflows. Volgens het bedrijf verschilt dit model van de meer generieke, wetenschapsbrede modellen die grote techbedrijven doorgaans aanbieden. Yunyun Wang, Life Sciences Product Lead bij OpenAI, noemde in een persbriefing twee belangrijke knelpunten waar het model op inspeelt: de overweldigende hoeveelheid data uit decennia van genoomsequencing en eiwitbiochemie, en de gespecialiseerde jargon en technieken binnen de vele subdisciplines van de biologie. Het model is verder getraind op het toegang krijgen tot grote publieke databases met biologische informatie en kan, volgens OpenAI, biologische pathways suggereren en potentiële medicijndoeleinden prioriteren.

Wat dit betekent

Voor Nederlandse bedrijven en onderzoekers in de life sciences, van startups tot gevestigde MKB’ers in farma, agro-biotech of medische diagnostiek, betekent dit een potentieel krachtige tool om efficiënter te werken. Het grootste probleem is vaak niet een gebrek aan data, maar de tijd en expertise die nodig zijn om die data te interpreteren en toe te passen. Een onderzoeker in de plantenveredeling die plotseling te maken krijgt met genetische data gerelateerd aan een specifieke ziekte, moet zich door een berg neurobiologische literatuur worstelen. Een gespecialiseerd model als GPT-Rosalind kan die kloof overbruggen door de relevante kennis en context uit die gespecialiseerde literatuur te filteren en te vertalen. Het kan onderzoek richten en hypotheses versnellen, wat de tijd tot innovatie of ontdekking kan verkorten.

Hoe je dit kunt toepassen

De praktische toepassing hangt sterk af van jouw specifieke situatie binnen de life sciences. Het model is ontworpen als een ondersteunende tool voor onderzoek en ontwikkeling.

Als je werkt in een farmaceutisch of biotech MKB… waar resources beperkt zijn, zou je het model kunnen gebruiken om literatuuronderzoek te versnellen. Stel, je onderzoekt een nieuw eiwit als potentieel medicijndoelwit. In plaats van weken te besteden aan het doorzoeken van databases en papers, zou je het model kunnen vragen om alle bekende pathways waarin dat eiwit een rol speelt te identificeren en te prioriteren op basis van bewijs. Dit richt je labwerk en kan dierproeven of dure experimenten in een vroeger stadium stroomlijnen.

Als je een diagnostisch bedrijf runt… dat zich richt op genetische testen, kan de kracht liggen in het interpreteren van varianten van onbekende betekenis. Een klant heeft een genetische mutatie waarvan de klinische impact onduidelijk is. Het model, getraind op het verbinden van genotype (het genetische profiel) met fenotype (de waarneembare eigenschappen), zou kunnen helpen bij het suggereren van de meest waarschijnlijke biologische mechanismen en bijbehorende literatuur, waardoor de geneticus een beter onderbouwde conclusie kan trekken.

Als je academicus of onderzoeker bent in een gespecialiseerd veld… zoals microbiologie, en je moet samenwerken met een team van celbiologen aan een gezamenlijk project, kan het model fungeren als een ‘vertaler’ van jargon en technieken. Je kunt het gebruiken om snel up-to-speed te komen over de standaardprotocollen en belangrijkste bevindingen in het vakgebied van je collega’s, wat de interdisciplinaire communicatie en samenwerking efficiënter maakt.

Bron: Arstechnica