Drug firms' secret data supercharge AI protein modelsGeheime data van farmabedrijven versterken AI-eiwitmodellenLes données secrètes des laboratoires pharmaceutiques dopent les modèles d'IA pour les protéines
Nature · 14 September 2026, at 16:31
Here's something really exciting - pharmaceutical companies are sitting on thousands of protein structures that could transform AI tools like AlphaFold. A consortium of drug firms just trained an improved model on over 20,000 proprietary protein structures, and the results are genuinely impressive compared to models trained only on public data. The thing is, these companies keep this data locked away because it's connected to their drug-development efforts, but now they're realizing that sharing it could help everyone build better AI tools. And that's opening the door to a whole new approach - generating publicly available datasets, like the OpenBind project, that could supercharge protein-folding AI for the entire research community.Dit is echt spannend - farmaceutische bedrijven hebben duizenden eiwitstructuren in hun kluizen die AI-tools zoals AlphaFold kunnen transformeren. Een consortium van geneesmiddelenbedrijven heeft zojuist een verbeterd model getraind met meer dan 20.000 eigendomsgegevens van eiwitstructuren, en de resultaten zijn werkelijk indrukwekkend in vergelijking met modellen die alleen op openbare data zijn getraind. Het probleem is dat deze bedrijven deze gegevens graag voor zich houden omdat ze gerelateerd zijn aan hun medicijnonderzoeksinspanningen, maar nu beseffen ze dat delen ervan iedereen kan helpen betere AI-tools te bouwen. En dat opent de deur naar een heel nieuwe aanpak - het genereren van openbaar beschikbare datasets, zoals het OpenBind-project, die protein-folding-AI voor de hele onderzoeksgemeenschap kunnen versterken.C'est vraiment passionnant - les entreprises pharmaceutiques ont des milliers de structures protéiques enfermées dans leurs coffres qui pourraient transformer les outils d'IA comme AlphaFold. Un consortium de fabricants de médicaments vient d'entraîner un modèle amélioré sur plus de 20 000 structures protéiques propriétaires, et les résultats sont vraiment impressionnants par rapport aux modèles formés uniquement sur des données publiques. Le problème est que ces entreprises gardent généralement ces données secrètes parce qu'elles sont liées à leurs efforts de développement de médicaments, mais maintenant elles réalisent que les partager pourrait aider tout le monde à construire de meilleurs outils d'IA. Et cela ouvre la porte à une approche entièrement nouvelle - générer des ensembles de données accessibles au public, comme le projet OpenBind, qui pourraient surcharger l'IA du repliement des protéines pour toute la communauté scientifique.