یک مدل جدید و هدفمند برای تسریع پژوهشهای علمی و کشف دارو
GPT Rosalind؛ دستیار پژوهشهای علوم زیستی
غول هوش مصنوعی OpenAI مدل استنتاجی پیشگام خود به نام GPT Rosalind که برای انجام پژوهشهای علوم زیستی، کشف دارو و پزشکی انتقالی (Translational Medicine) توسعه یافته است را منتشر کرد. سری مدلهای علوم زیستی با ترکیب بهرهگیری از ابزارهای بهبودیافته با درک عمیقتر در حوزههای شیمی، مهندسی پروتئین و ژنومیک، به طور اختصاصی برای جریانهای کاری علمی بهینهسازی شدهاند.
GPT Rosalind به عنوان یک پیشنمایش پژوهشی در ChatGPT، Codex و API برای کاربران واجد شرایط از طریق برنامه trusted access در دسترس است. همچنین یک افزونه پژوهشی علوم زیستی با قابلیت دسترسی آزاد برای Codex معرفی شده که به دانشمندان کمک میکند مدلها را به بیش از ۵۰ ابزار علمی و منبع داده متصل کنند. این مدل به افتخار «روزالیند فرانکلین» (Rosalind Franklin) نامگذاری شده است؛ کسی که پژوهشهای دقیق او به کشف ساختار DNA کمک کرد و پایههای زیستشناسی مولکولی مدرن را بنا نهاد.
بهینهشده برای کار علمی
سری مدلهای علوم زیستی GPT Rosalind برای انجام کارهای علمی مدرن روی شواهد منتشرشده، دادهها، ابزارها و آزمایشها ساخته شده است. در ارزیابیهای انجامشده، این مدل بهترین عملکرد را در وظایفی ارائه میدهد که نیازمند استنتاج بر روی مولکولها، پروتئینها، ژنها، مسیرهای زیستی و بیولوژی مرتبط با بیماری هستند. همچنین در استفاده از ابزارها و پایگاههای داده علمی در جریانهای کاری چندمرحلهای مانند مرور ادبیات، تفسیر توالی به عملکرد (Sequence-to-function)، برنامهریزی تجربی و تحلیل دادهها مؤثرتر عمل میکند.
«حوزه علوم زیستی در هر مرحله نیازمند دقت است. سؤالات بسیار پیچیده هستند، دادهها به شدت منحصربهفردند و ریسکها فوقالعاده بالاست. همکاری با OpenAI به ما این امکان را میدهد که پیشرفتهترین قابلیتها و ابزارهای آنها را به روشهای جدید و نوآورانهای به کار بگیریم که پتانسیل تسریع در نحوه ارائه داروها به بیماران را دارند.»
«شان برویچ» (Sean Bruich)، معاون ارشد هوش مصنوعی و داده شرکت Amgen
عملکرد و ارزیابی
GPT Rosalind در طیف وسیعی از قابلیتهای اساسی برای کشف علمی و پژوهشهای صنعتی ارزیابی شده است. این ارزیابیها استنتاجهای کلیدی در زیردامنههای علمی از جمله مکانیسمهای واکنش شیمیایی، ساختار پروتئین، اثرات جهش و تعاملات و تفسیر فیلوژنتیک توالیهای DNA را میسنجند. همچنین بررسی میکنند که آیا مدلها میتوانند با تفسیر خروجیهای تجربی، شناسایی الگوهای مرتبط با تخصص و ترکیب اطلاعات خارجی برای طراحی آزمایشهای پیگیری، از جریانهای کاری پژوهشی واقعی پشتیبانی کنند یا خیر. در نهایت، این بنچمارکها آزمایش میکنند که آیا مدلها میتوانند ابزارهای محاسباتی، پایگاههای داده و قابلیتهای مختص به دامنه مناسب را برای تقویت استنتاج خود انتخاب و استفاده کنند. در مجموع، این ارزیابیها پیشرفت را در سراسر فرایند پژوهشهای علمی نشان میدهند و حاکی از توانایی قویتر برای کمک به پژوهشگران در انجام وظایف چالشبرانگیزِ کشف هستند.

در بنچمارک LABBench2 که عملکرد را در طیفی از وظایف پژوهشی مانند بازیابی مقالات، دسترسی به پایگاه داده، دستکاری توالیها و طراحی پروتکل میسنجد، GPT Rosalind در ۶ وظیفه از ۱۱ وظیفه، عملکرد بهتری از GPT 5.4 نشان داد.
OpenAI با Dyno Therapeutics، شرکتی پیشگام در ژندرمانیهای طراحیشده با هوش مصنوعی همکاری کرد تا مدل را روی یک وظیفه پیشبینی و تولیدِ توالیِ RNA به عملکرد، با استفاده از توالیهای منتشرنشده و آلودهنشده (Uncontaminated) ارزیابی کند. عملکرد مدل با امتیاز ۵۷ که میانگین تاریخی متخصصان حوزه هوش مصنوعی در زیستشناسی (AI-bio) بود مقایسه شد. هنگام ارزیابی مستقیم در برنامه Codex، پاسخهای مدل در حالتِ بهترین از دهتا (Best-of-ten)، بالاتر از صدک ۹۵ متخصصان انسانی در وظیفه پیشبینی و در حدود صدک ۸۴ متخصصان انسانی در وظیفه تولید توالی قرار گرفت.

اتصال به ابزارهایی که دانشمندان استفاده میکنند
دانشمندان میتوانند از افزونه جدید پژوهش علوم زیستی برای Codex استفاده کنند که در GitHub در دسترس است. این بسته شامل مجموعه گستردهای از مهارتهای ماژولار برای رایجترین جریانهای کاری پژوهشی است و به گونهای طراحی شده تا به کاربران در انجام پژوهشهای ژنتیک انسانی، ژنومیک عملکردی، ساختار پروتئین، بیوشیمی، شواهد بالینی و کشفِ مطالعاتِ عمومی کمک کند.

این مهارتها به عنوان یک لایه ارکستراسیون عمل میکنند که به دانشمندان کمک میکند تا سؤالات گسترده، مبهم و چندمرحلهای را به نحو مؤثرتری بررسی کنند. این افزونه دسترسی به بیش از ۵۰ پایگاه داده عمومی Multi-omics، منابع مقالات و ابزارهای زیستشناسی را فراهم میکند و یک نقطه شروع منعطف برای جریانهای کاری تکرارپذیر و رایج، مانند جستوجوی ساختار پروتئین، جستجوی توالی، مرور مقالات و کشف مجموعهدادههای عمومی را ارائه میدهد.
