انجام پروژه با Cytoscape برای تحلیل شبکههای زیستی
انجام پروژه با Cytoscape برای تحلیل شبکههای زیستی
راهنمای جامع و گامبهگام انجام پروژه با Cytoscape در تحلیل شبکههای زیستی
فهرست مطالب مقاله
- چرا Cytoscape ابزار استاندارد تحلیل شبکههای زیستی است؟
- مرحله اول: آمادهسازی دادهها و ساختار فایلهای ورودی
- مرحله دوم: فراخوانی دادهها و تحلیل توپولوژیک شبکه
- مرحله سوم: شناسایی ژنهای کلیدی (Hub Genes) با CytoHubba
- مرحله چهارم: خوشهبندی شبکه و غنیسازی فرآیندهای زیستی
- مرحله پنجم: بصریسازی حرفهای و خروجی گرفتن برای مقاله
- جدول مقایسهای افزونههای کلیدی Cytoscape
- اشتباهات رایج در انجام پروژه Cytoscape و راه حل سریع
- پرسشهای متداول پژوهشگران
خلاصه کاربردی: تحلیل شبکههای زیستی (PPI، miRNA-mRNA و شبکه بیان ژن) در نرمافزار Cytoscape مستلزم چهار گام اصلی است: فرمتبندی درست دادههای خام، محاسبه شاخصهای توپولوژیک (مانند Degree و Betweenness)، شناسایی هابژنها با پلاگین cytoHubba، و ترسیم گرافهای استاندارد مقاله با سبکهای بصری (Style). در این راهنما تمام مراحلی که برای ارائه یک پروژه معتبر پژوهشی نیاز دارید بهصورت سناریومحور بررسی شده است.
آیا با دادههای حجم بالا (Omics) نظیر RNA-Seq یا پروتئومیکس روبرو هستید و در نگارش فصل چهارم پایاننامه یا مقاله خود برای تبدیل این لیستهای طولانی ژنی به شبکههای زیستی قابل تفسیر دچار چالش شدهاید؟ انجام پروژه با Cytoscape به شما این امکان را میدهد که دادههای خام تعاملات زیستی را به مدلهای بصری معنیدار تبدیل کرده و ژنهای کلیدی و مسیرهای سیگنالدهی اصلی را کشف کنید.
در این راهنمای جامع، روند کامل پیادهسازی پروژه با نرمافزار Cytoscape را از مرحله قالببندی فایلهای CSV و SIF تا استخراج زیرشبکههای مهم، تحلیل غنیسازی هستیشناسی ژن (GO) و گرفتن خروجیهای وکتور با کیفیت مجلات ISI مرور میکنیم.
مرحله اول: آمادهسازی دادهها و ساختار فایلهای ورودی

پاسخ کوتاه: برای ورود موفق دادهها به Cytoscape، سادهترین و مطمئنترین روش استفاده از فایلهای اکسل با فرمت CSV یا TSV شامل حداقل دو ستون اصلی است: ستون Source (ژن مبدأ) و ستون Target (ژن مقصد).
نرمافزار Cytoscape از چندین فرمت استاندارد مانند SIF (Simple Interaction Format)، NNF، GraphML و فایلهای متنی جداشده با کاما یا تب پشتیبانی میکند. برای پروژههای سیستمز بیولوژی (System Biology)، توصیه میشود دادههای خود را در دو جدول جداگانه در فایل اکسل سازماندهی کنید:
- جدول تعاملات (Edge Attribute Table): این جدول شامل ستونهای Node A، Interaction Type (مثلاً pp برای پروتئین-پروتئین یا reg برای تنظیمی)، و Node B است. همچنین میتوانید وزن تعامل (Score یا Combined Score) را در ستون دیگری وارد کنید.
- جدول ویژگیهای گرهها (Node Attribute Table): این جدول مشخصات فردی هر ژن/پروتئین را نگه میدارد؛ شامل میزان تغییر بیان (Fold Change)، مقدار P-value، نوع مولکول (TF، miRNA، ژن کدکننده) و موقعیت سلولی.
مرحله دوم: فراخوانی دادهها و تحلیل توپولوژیک شبکه

پاسخ کوتاه: پس از فراخوانی فایل از مسیر File > Import > Network from File، باید ابزار توکار NetworkAnalyzer را از منوی Tools فعال کنید تا تمامی شاخصهای ساختاری شبکه محاسبه شوند.
تحلیل ساختاری یا توپولوژیک، اولین گام پس از شکلگیری گراف اولیه است. شبکه باید از نظر جهتدار بودن (Directed) یا غیرجهتدار بودن (Undirected) تعیین وضعیت شود؛ شبکههای پروتئین-پروتئین (PPI) معمولاً غیرجهتدار و شبکههای تنظیمی (TF-Gene یا miRNA-Target) جهتدار محسوب میشوند.
- از منوی بالا گزینه
Tools -> NetworkAnalyzer -> Network Analysis -> Analyze Networkرا انتخاب کنید. - نوع شبکه (جهتدار یا غیرجهتدار) را تعیین کرده و روی OK کلیک کنید.
- پنجره نتایج شاخصهای کلیدی زیر را ارائه میدهد که باید در گزارش پروژه ثبت شوند:
- Degree (درجه): تعداد اتصالات مستقیم یک گره.
- Betweenness Centrality (مرکزیت مابینی): میزان قرارگیری گره در کوتاهترین مسیرهای بین سایر گرهها.
- Closeness Centrality (مرکزیت نزدیکی): سرعت دسترسی یک گره به تمام گرههای دیگر شبکه.
- Clustering Coefficient (ضریب خوشهبندی): میزان تمایل همسایگان یک گره به تشکیل خوشه.
مرحله سوم: شناسایی ژنهای کلیدی (Hub Genes) با CytoHubba

پاسخ کوتاه: افزونه cytoHubba برترین ابزار Cytoscape برای رتبهبندی و معرفی ژنهای مرکزی (Hub/Bottleneck Genes) است که با الگوریتمهایی نظیر MCC و Degree ده ژن برتر را استخراج میکند.
در بیشتر پروژههای بیوانفورماتیک، هدف نهایی تقلیل یک شبکه بزرگ با چند هزار یال به یک زیرشبکه حاوی ۱۰ الی ۲۰ ژن سرنوشتساز است. افزونه cytoHubba از ۱۱ روش توپولوژیک مختلف برای سنجش اهمیت گرهها استفاده میکند.
الگوریتمهای پیشنهادی برای مقالات علمی:
- MCC (Maximal Clique Centrality): طبق پژوهشهای اخیر، این الگوریتم دقیقترین روش برای پیشبینی پروتئینهای اساسی در شبکههای PPI است.
- Degree: سادهترین و در عین حال معتبرترین شاخص برای یافتن گرههای دارای بیشترین ارتباط مستقیم.
- MNC (Maximum Neighborhood Component): ایدهآل برای یافتن ژنهایی که در مرکز مجتمعهای پروتئینی قرار دارند.
نمونه سناریوی اجرای پروژه: ابتدا ۱۰ ژن برتر را بر اساس MCC استخراج کنید، سپس همین کار را با Betweenness انجام دهید. اشتراک (Intersection) این دو لیست که با نمودار ون (Venn Diagram) به دست میآید، مطمئنترین کاندیداها را برای تستهای آزمایشگاهی (Wet Lab) یا صحهگذاری با RT-qPCR معرفی میکند.
مرحله چهارم: خوشهبندی شبکه و غنیسازی فرآیندهای زیستی
پاسخ کوتاه: الگوریتم MCODE زیرشبکههای دارای تراکم بالا (ماژولها) را شناسایی کرده و افزونههایی مانند ClueGO یا STRING App وظیفه غنیسازی فرآیندهای زیستی (GO/KEGG) این ماژولها را بر عهده دارند.
شبکههای زیستی مقیاسناپذیر هستند و از ماژولهای functional تشکیل شدهاند. کشف این ماژولها به فهم زیرپدیدههای سلولی کمک میکند. روند استاندارد تحلیل ماژولار به شرح زیر است:
- شناسایی ماژولها با MCODE: تنظیم پارامترهای K-Core=2 و Degree Cutoff=2 جهت یافتن متراکمترین مجتمعهای پروتئینی در گراف.
- تحلیل آنالیز غنیسازی (Enrichment Analysis): ارزیابی ژنهای درون هر ماژول از نظر اصطلاحات هستیشناسی ژن (Gene Ontology: BP, CC, MF) و مسیرهای کیو (KEGG Pathways).
- تفسیر بیولوژیک: ارتباط دادن ماژولهای استخراجشده به بیماری مورد مطالعه (مثلاً فرآیند آپوپتوز یا مقاومت دارویی).
مرحله پنجم: بصریسازی حرفهای و خروجی گرفتن برای مقاله
پاسخ کوتاه: با استفاده از تب Style، اندازه گرهها را بر اساس Degree و رنگ آنها را بر اساس Log2 Fold Change تنظیم کنید، سپس شبکه را با فرمت SVG یا PDF خروجی بگیرید.
یکی از دلایل اصلی رد شدن یا اصلاحی خوردن مقالات زیستشناسی محاسباتی، تصاویر بیکیفیت، شلوغ و درهمتنیده (“موی سر یا Hairball”) است. برای داشتن یک تصویر خروجی خیرهکننده و استاندارد:
- چیدمان (Layout): از الگوریتمهای چیدمان نیرو-محور مانند
Layout -> Prefuse Force Directed LayoutیاDegree Sorted Circle Layoutبرای جداسازی گرهها استفاده کنید. - نگاشت بصری (Continuous/Discrete Mapping):
- رنگ گره (Node Fill Color): تغییرات بیان ژن (افزایش بیان = قرمز، کاهش بیان = آبی).
- اندازه گره (Node Size): متناسب با میزان درجه (Degree) یا امتیاز MCC (گرههای کلیدی بزرگتر دیده شوند).
- شکل گره (Node Shape): تمایز نوع مولکول (دایره برای ژن، لوزی برای miRNA، مربعی برای دارو).
- صدور خروجی (Export): گزینه
File -> Export -> Network View as Graphicsرا انتخاب کنید. فرمت را روی PDF یا SVG تنظیم کنید تا برداری بوده و کیفیت آن در چاپ یا زوم افت نکند. برای فرمت PNG حداقل رزولوشن را روی 300 DPI بگذارید.
جدول مقایسهای افزونههای کلیدی Cytoscape
شناخت افزونههای (Apps) کاربردی نرمافزار Cytoscape سرعت و کیفیت اجرای پروژه شما را به شدت افزایش میدهد:
| نام افزونه (App) | کاربرد اصلی در پروژه زیستی |
|---|---|
| cytoHubba | شناسایی ژنهای مرکزی و گرههای حیاتی شبکه با ۱۱ الگوریتم ریاضی. |
| MCODE | کشف ماژولها و خوشههای متراکم پروتئینی بر اساس تراکم اتصالات محلی. |
| STRINGapp | فراخوانی مستقیم دادههای تعاملات پروتئینی از پایگاه داده STRING بدون نیاز به دانلود جداگانه. |
| ClueGO / CluePedia | تحلیل غنیسازی Functional و ترسیم شبکههای هماهنگ هستیشناسی ژن و مسیرهای کگ (KEGG). |
| Merge Networks | ادغام یا اشتراکگیری بین چند شبکه مختلف (مثلاً شبکه ژنهای بیمار در برابر سالم). |
اشتباهات رایج در انجام پروژه Cytoscape و راه حل سریع
خطای اول: هنگ کردن نرمافزار هنگام وارد کردن شبکههای بزرگ
علت: اختصاص نیافتن حافظه RAM کافی به Java VM در نرمافزار.
راه حل سریع: فایل Cytoscape.vmoptions را در محل نصب برنامه ویرایش کرده و مقدار -Xmx8g را برای تخصیص ۸ گیگابایت رم تنظیم کنید.
خطای دوم: نامفهوم بودن گراف نهایی و همپوشانی شدید گرهها
علت: عدم فیلتر کردن تعاملات کمارزش (Low confidence score).
راه حل سریع: پیش از ساخت شبکه، تعاملات با امتیاز (Score) زیر ۰.۴ یا ۰.۷ (بستگی به دیتابیس) را فیلتر کنید و از چیدمان Organic یا Prefuse Force Directed استفاده نمایید.
خطای سوم: ایجاد گرههای ایزوله (بدون هیچ اتصالی)
علت: وارد کردن ژنهایی که در پایگاههای داده تعاملاتی شناختهشده ثبت نشدهاند.
راه حل سریع: از منوی Select -> Nodes -> Unconnected Nodes گرههای ایزوله را انتخاب و حذف (Delete) کنید تا ساختار شبکه پاکسازی شود.
پرسشهای متداول پژوهشگران
۱. تفاوت اصلی بین پلات آنلاین STRING و تحلیل در Cytoscape چیست؟
پایگاه آنلاین STRING تنها نمایش سادهای از تعاملات ارائه میدهد؛ اما Cytoscape امکان ادغام دادههای بیان ژن شخصی، اجرای الگوریتمهای پیچیده ریاضی (مانند MCC)، فیلتر بر اساس حدآستانهها و شخصیسازی بصری فوقالعاده کیفیتبالا برای مقاله را فراهم میسازد.
۲. حداقل سیستم سختافزاری مورد نیاز برای اجرای Cytoscape چیست؟
برای شبکههای کوچک تا متوسط (زیر ۵۰۰۰ گره) حداقل پردازنده Core i5 و ۸ گیگابایت RAM کافی است. اما برای آنالیز شبکههای عظیم ترانسکریپتومیکس، حداقل ۱۶ گیگابایت RAM توصیه میشود.
۳. چطور میتوانم شبکه miRNA-mRNA را در Cytoscape رسم کنم؟
کافی است لیست تارگتهای تأییدشده را از دیتابیسهایی نظیر TargetScan یا miRTarBase دانلود کنید، سپس آن را به صورت فایل دو ستونه (ستون ۱: miRNA، ستون ۲: Target Gene) وارد برنامه نموده و شکل گرهها را در تب Style برای این دو نوع مولکول متفاوت تنظیم کنید.
۴. کدام شاخص توپولوژیک برای معرفی ژنهای کلیدی در پایاننامه معتبرتر است؟
هیچ شاخص منحصربهفردی وجود ندارد؛ اما ترکیب شاخصهای Degree (تعداد اتصالات) و Betweenness Centrality (کنترل جریان اطلاعات) همراه با الگوریتم MCC از cytoHubba استانداردترین رویه در مقالات بیوانفورماتیک معتبر است.
سوالات متداول
برای انجام پروژه با Cytoscape به چه فایلهای ورودی نیاز داریم؟
سادهترین فرمت برای ورود دادهها فایلهای اکسل CSV یا TSV هستند که حداقل دو ستون Node A (مبدأ) و Node B (مقصد) دارند. همچنین میتوانید جدول ویژگیهای گرهها شامل میزان تغییر بیان و P-value را به عنوان فایل جداگانه وارد نرمافزار کنید.
بهترین الگوریتم برای شناسایی ژنهای کلیدی (Hub Genes) در cytoHubba چیست؟
الگوریتم MCC (Maximal Clique Centrality) طبق پژوهشهای بیوانفورماتیک دقیقترین روش برای پیشبینی پروتئینهای اساسی است. البته استفاده همزمان از شاخصهای Degree و Betweenness برای یافتن اشتراک ژنها توصیه میشود.
تفاوت شبکه جهتدار و غیرجهتدار در تحلیل شبکههای زیستی چیست؟
شبکههای پروتئین-پروتئین (PPI) معمولاً غیرجهتدار هستند زیرا تعامل دوطرفه است. در مقابل، شبکههای تنظیمی مانند miRNA-Target یا TF-Gene به دلیل داشتن جهت تنظیم، شبکه جهتدار محسوب میشوند.
چگونه ماژولها و خوشههای متراکم را در Cytoscape استخراج کنیم؟
افزونه MCODE ابزار استاندارد برای خوشهبندی شبکه و شناسایی ماژولهای متراکم است. پس از استخراج ماژولها، میتوانید با افزونههایی نظیر ClueGO تحلیل آنالیز غنیسازی فرآیندهای زیستی (GO/KEGG) را انجام دهید.