انجام پروژه با STRING برای تحلیل تعاملات پروتئینی
انجام پروژه با STRING برای تحلیل تعاملات پروتئینی
راهنمای جامع انجام پروژه با STRING برای تحلیل تعاملات پروتئینی (PPI)
اگر در حال انجام پایاننامه یا مقاله پژوهشی هستید و لیستی از ژنها یا پروتئینهای تغییریافته دارید، استخراج شبکه تعاملات پروتئینی (PPI) با پایگاه داده STRING گام اصلی شما برای کشف ژنهای کلیدی و مسیرهای زیستی است. این مقاله به شما آموزش میدهد چگونه پروژه خود را از ورود دادههای خام تا تنظیم پارامترهای پیشرفته، استخراج دادهها برای Cytoscape و نگارش استاندارد فصل روشها انجام دهید.
خلاصه کاربردی این مقاله
- آموزش گامبهگام ورود داده، تنظیم آستانه اطمینان (Confidence Score) و فیلتر منابع شواهد.
- روش صحیح آنالیز غنیسازی عملکردی (GO و KEGG) داخل پایگاه داده STRING.
- نحوه خروجیگرفتن استاندارد برای نرمافزارهای مکمل مانند Cytoscape.
- ارائه نمونه متن انگلیسی برای درج مستقیم در بخش روشهای (Methodology) مقاله یا پایاننامه.
فهرست مطالب
پایگاه داده STRING چیست و چه کاربردی دارد؟

پاسخ کوتاه: STRING یک پایگاه داده بیوانفورماتیکی جامع برای پیشبینی و ترسیم تعاملات فیزیکی و عملکردی بین پروتئینها است. این ابزار به پژوهشگران کمک میکند تا ارتباط میان ژنهای هدف را در قالب یک شبکه پیچیده زیستی تحلیل کنند.
در پروژههای زیستشناسی محاسباتی، ژنتیک و بیوانفورماتیک، معمولاً پس از تحلیل دادههای دادهکاوی (مانند RNA-seq یا Microarray)، با لیستی از دهها یا صدها ژن با تغییر بیان مواجه میشوید. بررسی تکتک این ژنها غیرممکن است. پایگاه داده STRING (Search Tool for the Retrieval of Interacting Genes/Proteins) این لیست را دریافت کرده و مشخص میکند کدام پروتئینها با یکدیگر همکاری، اتصال فیزیکی یا تنظیم مشترک دارند.
اطلاعات STRING از ۵ منبع اصلی تامین میشود: آزمایشهای تجربی ثبتشده، پایگاههای داده مسیرهای زیستی، پیشبینیهای ژنومیک (همبیانی و مجاورت ژنی)، متون علمی (Textmining) و انتقال دانش بینگونهای (Automated Textmining & Orthology).
مراحل گامبهگام انجام پروژه تحلیل تعاملات پروتئینی با STRING

برای اجرای یک پروژه استاندارد با ابزار STRING، کافی است مراحل زیر را بر اساس رویههای مرسوم پژوهشی دنبال کنید:
گام اول: آمادهسازی لیست ژنها (Input Data)
قبل از ورود به سایت STRING، شناسه (ID) ژنها را یکدست کنید. استفاده از Gene Symbol (مثل TP53، EGFR، TNF) یا شناسههای UniProt بهترین گزینه است. مطمئن شوید نام ژنها بدون فاصله اضافی یا خطای تایپی باشد.
گام دوم: ورود دادهها به STRING
- وارد سایت string-db.org شوید.
- از منوی سمت چپ، گزینه “Multiple Proteins” را انتخاب کنید.
- اسامی ژنها را در باکس مربوطه کپی کنید.
- در بخش Organism، نام دقیق موجود زنده را مشخص کنید (مثلاً Homo sapiens برای انسان).
- روی دکمه Search و سپس Continue کلیک کنید تا شبکه اولیه تشکیل شود.
گام سوم: تنظیم پارامترهای حیاتی (Settings)
شبکه اولیه معمولاً شلوغ یا غیردقیق است. برای استانداردسازی مقاله خود، وارد تب Settings شوید و پارامترها را طبق الگوی زیر تنظیم کنید:
- Network Type: اگر اتصال فیزیکی مستقیم مد نظر است روی Physical subnetwork و اگر تعاملات عملکردی و غیرمستقیم هم مهم است روی Full STRING network بگذارید.
- Required Score: آستانه اطمینان را بر اساس حجم ژنها تنظیم کنید (کمتر از ۵۰ ژن: ۰٫۷۰۰ یا High Confidence؛ بالای ۲۰۰ ژن: ۰٫۹۰۰ یا Highest Confidence).
- Meaning of network edges: گزینه Confidence را انتخاب کنید تا ضخامت خطوط نشاندهنده میزان اعتبار تعامل باشد.
- Active Interaction Sources: اگر میخواهید نتایج صرفاً بر پایه شواهد آزمایشگاهی باشد، گزینه Textmining را غیرفعال کنید.
گام چهارم: تحلیل آنالیز غنیسازی (Functional Enrichment)
وارد تب Analysis شوید. در این بخش، پایگاه داده STRING بهصورت خودکار نتایج آنتولوژی ژن (Gene Ontology) و مسیرهای کیگ (KEGG Pathways) را ارائه میدهد. دادههای سه بخش زیر را بررسی و دانلود کنید:
- Biological Process (فرآیندهای زیستی غنیشده)
- Molecular Function (عملکردهای مولکولی)
- KEGG Pathways (مسیرهای سیگنالدهی مرتبط)
گام پنجم: خروجیگرفتن و انتقال دادهها
برای تحلیلهای پیشرفتهتر (مانند محاسبه Hub-Genes با الگوریتم MCC)، باید دادهها را صادرات (Export) کنید. وارد تب Exports شوید:
- برای نرمافزار Cytoscape: فایل با فرمت TSV یا GraphML را دانلود کنید.
- برای تصویر مقاله: تصویر با فرمت SVG یا PNG High-resolution را دانلود کنید.
مقایسه آستانههای اطمینان (Confidence Score) در STRING

یکی از مهمترین تصمیمات در پروژه، انتخاب حد حد نصاب امتیاز تعامل (Combined Score) است. جدول زیر راهنمای انتخاب صحیح این پارامتر است:
| آستانه اطمینان (Score Cutoff) | کاربرد پژوهشی و زمینه پیشنهادی |
|---|---|
| Low Confidence (0.150) | پژوهشهای اکتشافی اولیه؛ زمانی که تعداد ژنهای ورودی بسیار کم (کمتر از ۱۰ ژن) است. |
| Medium Confidence (0.400) | تنظیم پیشفرض سایت؛ مناسب برای مرور کلی اما معمولاً برای مقالات معتبر نیاز به فیلتر بیشتر دارد. |
| High Confidence (0.700) | استاتدارد مقالات علمی؛ بهترین تعادل میان حذف دادههای کاذب و حفظ تعاملات واقعی. |
| Highest Confidence (0.900) | مناسب برای پروژههای با تعداد ژن بسیار بالا (بیش از ۳۰۰ ژن) جهت کشف فقط قطعیترین تعاملات. |
نمونه متن استاندارد برای نگارش بخش روشها (Methodology)
برای اینکه مشخصات پروژه شما در پایاننامه یا مقاله دقیق و قابل بازتولید (Reproducible) باشد، میتوانید از ساختار متنی زیر در بخش Materials and Methods استفاده کنید:
اشتباهات رایج و راهکار سریع
۱. عدم تطابق شناسه ژنها (Gene ID Discrepancy)
خطا: وارد کردن نامهای مترادف غیرمستاندر یا قدیمی که باعث شناسایی نشدن ژن در STRING میشود.
راهکار سریع: قبل از ورود داده، اسامی را با پایگاه داده HGNC (برای انسان) یا UniProt همگامسازی کنید.
۲. اتکا به تنظیمات پیشفرض (Default Bias)
خطا: استفاده از Score پیشفرض (0.400) و فعال بودن Textmining که باعث ایجاد شبکهای بسیار شلوغ با روابط غیرواقعی میشود.
راهکار سریع: همیشه حد نصاب را روی 0.700 قرار داده و منابع داده را در گزارش مقاله دقیقاً ذکر کنید.
۳. رها کردن ژنهای منفرد (Disconnected Nodes)
خطا: حذف ژنهای بیارتباط بدون ذکر علت در مقاله.
راهکار سریع: در تنظیمات یا در متن گزارش تصریح کنید که ژنهای بدون تعامل (Singletons) از ترسیم گراف نهایی حذف شدهاند اما در آنالیز اولیه حضور داشتهاند.
پرسشهای متداول
خیر، STRING پایگاه داده پایهای است. معمولاً باید خروجی شبکه را وارد نرمافزار Cytoscape کنید، با افزونههایی مثل cytoHubba ژنهای کلیدی (Hub-Genes) را شناسایی کرده و در صورت امکان با دادههای بالینی یا آزمایشگاهی اعتبارسنجی کنید.
شاخص PPI enrichment p-value نشان میدهد که آیا ژنهای شما بیش از حد تصادفی با هم اتصال دارند یا خیر. اما FDR (False Discovery Rate) خطای آماری در آنالیز غنیسازی مسارات (GO/KEGG) را پس از تصحیح آزمونهای چندگانه کنترل میکند.
این اتفاق طبیعی است. میتوانید حد نصاب Score را به 0.400 کاهش دهید یا بخش Textmining را فعال کنید. اگر باز هم تعاملی یافت نشد، نشاندهنده ناشناخته بودن تعاملات این پروتئین در مطالعات کنونی است.
در تب Settings، از بخش “More/Less Interactors”، میتوانید تعیین کنید که ابزار چند پروتئین متصلشونده کلیدی (First shell یا Second shell) را که در لیست اولیه شما نبودهاند به شبکه اضافه کند.
سوالات متداول
پایگاه داده STRING چیست و چه کاربردی دارد؟
STRING یک پایگاه داده بیوانفورماتیکی جامع برای پیشبینی و ترسیم شبکههای تعاملی فیزیکی و عملکردی میان پروتئینها است. این ابزار به پژوهشگران در شناسایی ژنهای کلیدی و مسیرهای زیستی کمک میکند.
بهترین آستانه اطمینان (Confidence Score) در STRING کدام است؟
برای اکثر مقالات و پژوهشهای معتبر علمی، حد نصاب High Confidence (0.700) بهترین تعادل را میان حذف دادههای کاذب و حفظ تعاملات واقعی ایجاد میکند.
چگونه دادههای STRING را وارد نرمافزار Cytoscape کنیم؟
میتوانید از تب Exports در سایت STRING، فایل شبکه را با فرمت TSV یا GraphML دانلود کرده و آن را مستقیماً در نرمافزار Cytoscape بارگذاری نمایید.
چرا غیرفعال کردن گزینه Textmining در STRING توصیه میشود؟
غیرفعال کردن Textmining باعث حذف دادههای متنی غیردقیق و نویز شبکه میشود و تمرکز آنالیز را بر شواهد آزمایشگاهی و تجربی معتبر میگذارد.