پیوست: پایگاههای دادهٔ باز در علوم اعصاب
تا اینجای کتاب، تقریباً همهٔ دادههایی که با آنها کار کردیم را خودمان ساخته بودیم: از یک نوسانگر انتگرال گرفتیم، یک نورون هاجکین–هاکسلی را شبیهسازی کردیم، یا نوفهای مصنوعی به سیگنال افزودیم. این کار برای یادگیریِ روشها ایدهآل است، چون پاسخِ درست را از پیش میدانیم. اما پژوهشِ واقعی جای دیگری است: در آنجا داده از مغزِ یک موش یا یک انسان میآید، پاسخِ درست را کسی نمیداند، و بخشِ بزرگی از کار صرفِ فهمیدنِ این میشود که داده اصلاً چیست و چگونه ثبت شده است.
خبرِ خوب این است که برای شروع لازم نیست آزمایشگاه داشته باشید. در دو دههٔ گذشته، جامعهٔ علوم اعصاب مقدارِ چشمگیری داده را آزادانه منتشر کرده است: از اسپایکِ صدها هزار نورونِ ثبتشده با نوروپیکسل تا EEGِ بیمارانِ صرعی و تصویربرداریِ طولیِ هزاران فرد. این پیوست فهرستی است از پایگاههایی که برای شروعِ یک پروژهٔ محاسباتی مناسباند، همراه با اینکه هر کدام دقیقاً چه چیزی دارند و به دردِ چه پرسشی میخورند.
این پیوست کد ندارد
اینجا فقط معرفی و نقشهٔ راه است. نحوهٔ بارگذاری و پیشپردازشِ عملیِ هر یک از این دادهها موضوعِ پیوستهای جداگانهای است که بهتدریج افزوده میشوند. آنچه در این صفحه میخوانید، برای این است که پیش از نوشتنِ نخستین خطِ کد بدانید سراغِ کدام داده بروید و چرا.
پیش از انتخابِ داده: شش پرسش
پیش از آنکه گیگابایتها داده دانلود کنید، خوب است این شش پرسش را دربارهٔ هر پایگاه از خودتان بپرسید. پاسخ به اینها معمولاً چند ساعت وقت میگیرد و چند هفته وقت نجات میدهد.
-
مقیاسِ ثبت چیست؟ داده در چه سطحی از سازمانیافتگیِ مغز ثبت شده است؟ اسپایکِ تکنورون، پتانسیلِ میدانیِ موضعی (LFP)، EEGِ سطحِ پوستِ سر، یا سیگنالِ همودینامیکِ fMRI؟ این انتخاب تعیین میکند که چه پرسشی اصلاً قابلِطرح است. با EEGِ ۲۳ کاناله نمیتوان دربارهٔ کدگذاریِ تکنورون حرف زد، و با ثبتِ نوروپیکسل در قشرِ بینایی موش نمیتوان دربارهٔ شبکههای کلانِ مغزِ انسان.
-
بسامدِ نمونهبرداری و پهنای باند چقدر است؟ این را در فصلِ پردازش سیگنال در حوزهٔ فرکانس دیدیم: بسامدِ نایکوئیست سقفِ آنچه را که میتوانید ببینید تعیین میکند. دادهٔ ۱۷۳ هرتزی هرگز به شما دربارهٔ نوساناتِ گاما بالای ۸۰ هرتز چیزِ قابلِاعتمادی نمیگوید.
-
برچسبگذاری چگونه است؟ آیا رویدادها (تشنج، محرک، پاسخِ رفتاری) با دقتِ زمانی مشخصاند؟ چه کسی و با چه معیاری برچسب زده است؟ در دادهٔ بالینی، برچسبها معمولاً حاصلِ قضاوتِ چند متخصصاند و خودشان عدمِقطعیت دارند.
-
حجم و ساختارِ فایلها چیست؟ یک مجموعهٔ ۲ مگابایتیِ متنی را روی لپتاپ باز میکنید؛ یک مجموعهٔ ۴۰ گیگابایتی نیازمندِ برنامهریزی برای فضای دیسک و زمانِ دانلود است؛ و مجموعههای چند ترابایتی را اصلاً دانلود نمیکنند، بلکه با دسترسیِ ابری و الگوریتمهای بارگذاریِ تنبل (lazy loading) میخوانند.
-
مجوز و شرایطِ دسترسی چیست؟ برخی دادهها کاملاً باز و بدونِ ثبتناماند؛ برخی نیازمندِ ساختِ حساباند؛ و برخی نیازمندِ درخواستِ رسمی، تأییدِ کمیته و امضای توافقنامهٔ استفاده از دادهاند. این تفاوت میتواند چند هفته به زمانبندیِ پروژه اضافه کند.
-
چگونه باید ارجاع داده شود؟ تقریباً همهٔ این پایگاهها مقالهٔ مرجعی دارند که استفاده از داده مستلزمِ ارجاع به آن است. این یک تشریفات نیست: کارِ کسانی که سالها صرفِ ثبت و انتشارِ داده کردهاند تنها از همین راه دیده میشود.
دادههای الکتروفیزیولوژی حیوانی
International Brain Laboratory (IBL)
چیست. یک همکاریِ بینالمللیِ بزرگ که در آن دهها آزمایشگاه، یک تکلیفِ رفتاریِ یکسان را روی موش اجرا کردهاند و در حینِ آن با کاوشگرهای نوروپیکسل (Neuropixels) از سراسرِ مغز ثبت گرفتهاند. تکلیف، یک تصمیمگیریِ بینایی است: در هر آزمایش یک گِرِیتینگ (grating؛ الگویی از نوارهای روشن و تاریکِ متناوب، که محرکِ استانداردِ پژوهشهای بینایی است) در سمتِ چپ یا راستِ صفحه ظاهر میشود و موش باید چرخی را بچرخاند تا آن را به مرکزِ صفحه بیاورد. کنتراستِ گِرِیتینگ، یعنی اختلافِ روشناییِ نوارهای روشن و تاریکِ آن، از آزمایشی به آزمایشِ دیگر تغییر میکند: در کنتراستِ بالا تشخیص آسان است و در کنتراستِ نزدیک به صفر، حیوان عملاً حدس میزند. همین تغییرِ کنتراست است که تکلیف را به آزمونی برای تصمیمگیری در شرایطِ عدمِقطعیت بدل میکند، نه صرفاً یک پاسخِ حسیِ ساده.
نکتهٔ کلیدیِ IBL این است که استانداردسازیِ پروتکل، مقایسهٔ میان آزمایشگاهها را ممکن میکند؛ چیزی که در علوم اعصاب کمیاب است.
چه دادهای دارد. انتشارِ «نقشهٔ سراسریِ مغز» (Brain Wide Map) شاملِ ۴۵۹ نشستِ ثبت (session؛ یک جلسهٔ ثبت از یک حیوان در یک روز، از آغاز تا پایانِ کارِ آن روز) با ۶۹۹ فروبردنِ کاوشگر (insertion؛ هر بار که یک کاوشگر در مغز فرو میرود، چون در یک نشست ممکن است چند کاوشگر همزمان کار بگذارند) در ۱۳۹ موش از ۱۲ آزمایشگاه و پوششِ ۲۴۱ ناحیهٔ مغزی است. در مجموع ۶۲۱٬۷۳۳ واحد شناسایی شده که از این میان ۷۵٬۷۰۸ واحد معیارهای کنترلِ کیفیت را میگذرانند.
چرا «واحد» و نه «نورون»؟
الکترود ولتاژ را ثبت میکند، نه هویتِ سلولها را. هر الکترود اسپایکِ چند نورونِ همسایه را با هم میبیند، و الگوریتمِ اسپایکسورتینگ باید این اسپایکها را بر پایهٔ شکلِ موجشان به خوشههایی تفکیک کند. به هر خوشه یک واحد (unit) میگویند: مجموعهای از اسپایکها که احتمالاً از یک نورونِ واحد آمدهاند. این «احتمالاً» مهم است. یک واحد ممکن است در واقع اسپایکِ دو نورون باشد که به هم چسبیدهاند، یا برعکس، اسپایکهای یک نورون میانِ دو واحد تقسیم شده باشد. به همین دلیل واحدها را با معیارهای کنترلِ کیفیت غربال میکنند، و در IBL از ۶۲۱٬۷۳۳ واحدِ خام تنها ۷۵٬۷۰۸ واحد از این غربال میگذرند. در تحلیلهای خود همیشه مشخص کنید که با کدام مجموعه کار میکنید.
هر نشست چند لایهٔ داده دارد:
- زمانِ اسپایکها پس از اسپایکسورتینگ، بههمراه شناسهٔ واحد، ناحیهٔ آناتومیکِ نسبتدادهشده و معیارهای کیفیت
- شکلِ موجِ اسپایکها برای هر واحد
- سیگنالِ خام در دو باند: باندِ AP (پتانسیلِ عمل) و باندِ LFP
- دادهٔ رفتاری: زمانبندیِ آزمایشها، محرک، پاسخ، زمانِ واکنش و موقعیتِ لحظهایِ چرخ
- ویدئو از چهره و بدنِ حیوان بههمراه موقعیتِ نقاطِ کلیدی از تحلیلِ DeepLabCut
دسترسی. با کتابخانهٔ پایتونیِ ONE-api (Open Neurophysiology Environment). پایگاهِ عمومی روی openalyx.internationalbrainlab.org قرار دارد و با نامِ کاربریِ intbrainlab و گذرواژهٔ international باز است؛ یعنی عملاً بدونِ نیاز به ثبتنام. داده روی AWS نیز قرار داده شده است. کارِ ONE این است که بهجای دانلودِ کلِ مجموعه، فقط همان فایلهایی را که میخواهید (مثلاً اسپایکهای یک کاوشگر در یک نشست) بگیرد و کَش (cache) کند.
به چه دردی میخورد. این بهترین نقطهٔ شروع برای پرسشهایی است که به اسپایکِ تکنورون در بافتارِ رفتار نیاز دارند: ساختنِ راستِرپلات و منحنیِ تنظیم، سنجشِ همبستگیِ نوفه میان جفتنورونها، رمزگشاییِ تصمیمِ حیوان از فعالیتِ جمعیت، یا مقایسهٔ تأخیرِ پاسخ میان نواحیِ مغزی. چون باندِ LFP هم موجود است، میتوان تحلیلهای زمان–بسامدِ فصلِ تحلیل زمان–بسامد را روی دادهٔ واقعی تمرین کرد و مثلاً جفتشدگیِ اسپایک به فازِ نوسانِ LFP را سنجید.
پیوندها. شروعِ سریع با ONE · نمونههای بارگذاریِ داده · مقالهٔ مرجع: IBL و همکاران، Nature (۲۰۲۵)، DOI
Allen Brain Observatory
چیست. مجموعهای از دادگانهای استانداردشده از مؤسسهٔ Allen که فعالیتِ قشرِ بینایی موش را در پاسخ به یک کتابخانهٔ ثابت از محرکهای بینایی ثبت کرده است. دو شاخهٔ اصلی دارد که مکملِ یکدیگرند.
«تراریخته» و «ردهٔ Cre» یعنی چه؟
حیوانِ تراریخته (transgenic) حیوانی است که ژنی بهعمد به ژنومش افزوده شده است. در علوم اعصاب، معمولترین کاربردِ آن این است که بتوانیم یک ردهٔ ژنتیکیِ مشخص از سلولها را نشاندار کنیم.
ابزارِ متداولِ این کار سامانهٔ Cre-lox است. Cre آنزیمی است که DNA را در نقاطِ نشانهداری به نامِ loxP میبُرد و بازترکیب میکند. در یک ردهٔ Cre، ژنِ این آنزیم چنان کار گذاشته میشود که فقط در سلولهایی بیان شود که ژنِ معینی را روشن کردهاند؛ مثلاً Pvalb-IRES-Cre یعنی Cre تنها در نورونهایی ساخته میشود که پروتئینِ پارووالبومین میسازند، و اینها زیرگونهای شناختهشده از نورونهای مهاریاند. سپس این حیوان با یک ردهٔ گزارشگر آمیخته میشود که ژنِ یک پروتئینِ فلورسان یا یک حسگرِ کلسیمی مانندِ GCaMP را دارد، اما این ژن پشتِ یک قطعهٔ «توقف» میانِ دو loxP قفل شده است. هرجا Cre باشد، قفل برداشته میشود.
نتیجه این است که فقط همان ردهٔ سلولیِ هدف حسگر را بیان میکند. برای همین در دادهٔ Allen میدانید هر ردِ فعالیت به کدام نوعِ سلولی تعلق دارد، و این چیزی است که ثبتِ الکتریکیِ معمولی به شما نمیدهد. در ثبتهای الکتریکی هم از همین ترفند استفاده میشود، با این تفاوت که ژنِ گزارشگر یک کانالِ نوری (مانندِ ردهٔ گزارشگرِ Ai32) است: با تاباندنِ نور میتوان همان سلولها را فعال کرد و از روی پاسخشان هویتشان را در میانِ صدها واحدِ ثبتشده بازشناخت.
تصویربرداریِ کلسیمیِ دوفوتونی (Visual Coding 2P). بیش از ۶۳٬۰۰۰ نورون در ۱۴ ردهٔ تراریختهٔ Cre، شش ناحیهٔ بیناییِ قشری (VISp و پنج ناحیهٔ بالاتر) و چهار عمقِ قشری. محرکها شاملِ گِرِیتینگ، نوفهٔ تُنُکِ موضعی، صحنههای طبیعی و فیلمهای طبیعیاند. مزیتِ این شاخه، هویتِ سلولیِ مشخص است: میدانید هر ردِ فعالیت به کدام نوعِ سلولی و کدام لایه تعلق دارد. عیبش، وضوحِ زمانیِ پایین و غیرمستقیمبودنِ سیگنالِ کلسیم نسبت به اسپایک است.
ثبتِ نوروپیکسل (Visual Coding Neuropixels). نزدیک به ۱۰۰٬۰۰۰ نورون از موشهای نوعِ وحشی (wild-type، یعنی بدونِ دستکاریِ ژنتیکی) و سه ردهٔ تراریخته، با ثبتِ همزمان از نواحیِ بیناییِ قشری، تالاموس (LGN و LP) و هیپوکامپ. دو مجموعهٔ محرکی دارد: یکی همارزِ محرکهای شاخهٔ دوفوتونی برای مقایسهٔ مستقیمِ دو روش، و دیگری با محرکهای تکراری برای تحلیلِ اتصالِ کارکردیِ میانناحیهای.
پایگاهِ انواعِ سلولی و ریختشناسیِ سهبعدی (Cell Types Database). این شاخه با دو شاخهٔ بالا فرق دارد: موضوعش نه پاسخِ جمعیتی به محرک، بلکه خودِ تکنورون است. از هر سلول در برشِ مغزی با روشِ پچکلمپِ تمامسلولی ثبت میگیرند و در حینِ ثبت آن را با بیوسیتین پر میکنند؛ سپس سلولِ رنگگرفته را لایهبهلایه تصویربرداری و بهصورتِ سهبعدی بازسازی میکنند. خروجی برای هر سلول سه چیز است که به هم گره خوردهاند: پاسخِ الکتریکی به پروتکلهای استاندارد (پلههای بلند، پالسهای کوتاه، شیبهای آهسته و نوفهٔ طبیعینما)، ریختشناسیِ سهبعدی در قالبِ فایلِ SWC، و در بسیاری موارد نیمرخِ بیانِ ژن. داده هم از موش و هم از بافتِ انسانی موجود است. افزون بر داده، مدلهای آماده هم منتشر شدهاند: مدلهای GLIF (انتگرالگیر-و-آتشِ نشتدارِ تعمیمیافته) و مدلهای بیوفیزیکی در دو نسخهٔ پیراسومایی (دندریتِ غیرفعال، سومای فعال) و تمام-فعال، که پارامترهایشان به همان سلولِ ثبتشده برازش خورده است.
فایلِ SWC چیزی جز یک جدولِ متنی نیست: هر سطر یک نقطه روی درختِ نورون است با مختصاتِ سهبعدی، شعاع، نوعِ بخش (سوما، دندریت، آکسون) و شناسهٔ نقطهٔ والد. همین ساختارِ ساده کافی است تا شبیهسازها هندسهٔ واقعیِ سلول را بازبسازند و آن را به مدلِ تقسیمی (compartmental) تبدیل کنند؛ یعنی دقیقاً همان کاری که در فصلِ کابل و مدلهای تقسیمی بهصورتِ نظری دیدیم. ابزارِ متعارفِ این کار NEURON است، و NetPyNE که روی NEURON سوار میشود و به شما اجازه میدهد شبکهای از همین سلولهای تفصیلی را با یک توصیفِ اعلانی بسازید، بهصورتِ موازی اجرا کنید و تحلیل کنید. AllenSDK نیز مدلهای بیوفیزیکیِ آماده را با موتورِ NEURON اجرا میکند.
اهمیتِ عملیِ این پایگاه در همینجاست: تا وقتی با نورونِ نقطهای کار میکنید، هندسه اهمیتی ندارد. اما بهمحضِ آنکه بخواهید بپرسید ورودیِ سیناپسی روی دندریتِ دور چقدر تضعیف میشود، یا یک شاخهٔ دندریتی کِی خودش رویداد فعال تولید میکند، به هندسهٔ واقعی نیاز دارید و ساختنِ آن از روی حدس بیمعناست. اگر ریختشناسیِ گونه یا ناحیهٔ دیگری میخواهید، NeuroMorpho.Org بزرگترین آرشیوِ تجمیعیِ بازسازیهای سهبعدی از آزمایشگاههای سراسرِ دنیا است و آن هم بر همان قالبِ SWC استوار است.
دسترسی. با کتابخانهٔ AllenSDK در پایتون؛ فایلها در قالبِ NWB (Neurodata Without Borders) هستند و روی AWS هم در دسترساند. پایگاهِ Cell Types نیز از راهِ همین SDK و APIِ Allen در دسترس است. مؤسسهٔ Allen منابعِ دیگری هم دارد که ارزشِ شناختن دارند: اطلسِ اتصالاتِ موش و اطلسهای مرجعِ آناتومیک.
به چه دردی میخورد. چون محرکها استاندارد و کتابخانهایاند، این داده برای پرسشهای کدگذاریِ حسی ایدهآل است: منحنیِ تنظیمِ جهت و بسامدِ فضایی، سلسلهمراتبِ نواحیِ بینایی، تفاوتِ پاسخِ زیرگونههای مهاری، و مقایسهٔ آنچه یک مدل پیشبینی میکند با آنچه واقعاً ثبت شده است. پایگاهِ Cell Types هم پلی است میانِ بیوفیزیکِ فصلِ غشا و پارامترهای واقعیِ نورون: با ردهای الکتریکیِ آن میتوان مدلهای هاجکین–هاکسلی و LIF و AdEx را به دادهٔ یک سلولِ مشخص برازش داد، و با فایلهای SWC همان سلول را بهصورتِ گسترده در فضا شبیهسازی کرد.
پیوندها. پورتالِ Allen Brain Map · پایگاهِ Cell Types · مستنداتِ AllenSDK · مدلهای بیوفیزیکی در AllenSDK
دادههای EEG انسانی
CHB-MIT Scalp EEG Database
چیست. ثبتِ طولانیمدتِ EEGِ پوستِ سر از کودکان و نوجوانانِ مبتلا به تشنجِ مقاوم به دارو، جمعآوریشده در بیمارستانِ کودکانِ بوستون. بیماران برای ارزیابیِ جراحی، داروی ضدتشنجِ خود را قطع کرده بودند و چند روز پیوسته تحتِ پایش بودند؛ به همین دلیل این مجموعه هم دورههای طولانیِ بینتشنجی دارد و هم تشنجهای واقعی.
چه دادهای دارد.
- ۲۲ فرد مورد آزمایش در قالبِ ۲۳ پرونده (۵ پسر ۳ تا ۲۲ ساله، ۱۷ دختر ۱٫۵ تا ۱۹ ساله)
- ۶۶۴ فایلِ
.edf، در مجموع حدودِ ۴۲٫۶ گیگابایت - ۱۹۸ تشنج که آغاز و پایانِ هر یک در فایلهای حاشیهنویسیِ
.seizureمشخص شده است؛ ۱۲۹ فایل دستِکم یک تشنج دارند - بسامدِ نمونهبرداری ۲۵۶ هرتز، تفکیکِ ۱۶ بیت، معمولاً ۲۳ کانال (در برخی پروندهها ۲۴ یا ۲۶) بر پایهٔ سیستم ۱۰–۲۰؛ برخی ثبتها کانالِ ECG یا سیگنالِ تحریکِ عصبِ واگ هم دارند
- بیشترِ فایلها یکساعتهاند؛ چند پرونده فایلهای دو یا چهارساعته دارند
دسترسی. کاملاً باز، بدونِ ثبتنام، از PhysioNet؛ با مجوزِ Open Data Commons Attribution v1.0. میتوان کلِ مجموعه را با wget یا با ابزارِ wfdb گرفت.
به چه دردی میخورد. این متداولترین محکِ عمومی برای آشکارسازی و پیشبینیِ تشنج است، و برای همین هم نقطهٔ قوت و هم دامِ اصلیِ آن همینجاست. کارهای ساده و آموزنده: مقایسهٔ چگالیِ طیفیِ توان در پنجرههای تشنجی و بینتشنجی، ردیابیِ گسترشِ تشنج روی کانالها، و سنجشِ همزمانیِ میانکاناله در آستانهٔ تشنج، که مستقیماً به مفاهیمِ فصلهای فیلترها و تحلیل زمان–بسامد وصل میشود.
دامِ ارزیابی
اگر پنجرههای آموزش و آزمون را بهصورتِ تصادفی از کلِ داده انتخاب کنید، پنجرههای مجاور از یک تشنجِ واحد در هر دو مجموعه میافتند و مدل عملاً همان تشنج را «بهخاطر میسپارد». نتیجه دقتِ ۹۹ درصدی است که هیچ معنایی ندارد. تقسیم باید در سطحِ بیمار یا دستِکم در سطحِ تشنج انجام شود. بسیاری از مقالاتِ منتشرشده روی این داده دقیقاً همین اشتباه را دارند.
پیوند. صفحهٔ داده در PhysioNet · ارجاع: Guttag, J. (2010), PhysioNet، DOI: 10.13026/C2K01R
Bonn EEG Dataset
چیست. مجموعهٔ کلاسیکی که Andrzejak و همکارانش در دانشگاهِ بُن در سالِ ۲۰۰۱ منتشر کردند. برخلافِ مجموعههای امروزی، این داده کوچک، تمیز و از پیش قطعهبندیشده است و دقیقاً به همین دلیل هنوز مفید است: میتوان آن را در چند ثانیه در حافظه بارگذاری کرد و روی آن روشها را آزمود.
چه دادهای دارد. پنج مجموعه، هر یک با ۱۰۰ قطعهٔ تککاناله. هر قطعه ۴۰۹۶ نمونه با بسامدِ نمونهبرداریِ ۱۷۳٫۶۱ هرتز دارد، یعنی حدودِ ۲۳٫۶ ثانیه، و در قالبِ فایلِ متنیِ ساده ذخیره شده است. طبقِ مقالهٔ اصلی، ثبت با تفکیکِ ۱۲ بیت و فیلترِ میانگذرِ ۰٫۵۳ تا ۴۰ هرتز انجام شده است.
| مجموعه | نامِ فایل | منبع | وضعیت |
|---|---|---|---|
| A | Z | EEGِ سطحی، ۵ داوطلبِ سالم | چشمبازِ آرام |
| B | O | EEGِ سطحی، همان داوطلبان | چشمبسته |
| C | N | ثبتِ درونجمجمهای، بیمارانِ صرعی | بینتشنجی، نیمکرهٔ مقابلِ کانون |
| D | F | ثبتِ درونجمجمهای، همان بیماران | بینتشنجی، داخلِ ناحیهٔ صرعزا |
| E | S | ثبتِ درونجمجمهای، همان بیماران | حینِ تشنج |
دسترسی. فایلهای zip بهصورتِ عمومی از صفحهٔ گروهِ تحلیلِ سریهای زمانیِ غیرخطیِ UPF قابلِ دانلودند. حجمِ کل چند مگابایت است.
به چه دردی میخورد. این بهترین دادهٔ تمرینی در این فهرست است. چون قطعهها همطول و برچسبدارند، میتوانید بیدرنگ سراغِ خودِ روش بروید: طیفِ توان، آنتروپیِ نمونهای، بُعدِ همبستگی، بیشترین نمایِ لیاپانوف و بازسازیِ فضای فاز. توجه کنید که این داده تاریخاً محکِ اصلیِ تحلیلِ غیرخطیِ سریهای زمانی بوده است، و مستقیماً به فصلِ سیستمهای غیرخطی و نظریهٔ آشوب وصل میشود.
کوچکبودن هم عیب است
۵۰۰ قطعه از تعدادِ اندکی آزمودنی، برای آموزشِ مدلهای یادگیریِ عمیق کافی نیست. دقتهای نزدیک به ۱۰۰ درصد که در ادبیاتِ این داده فراواناند، بیشتر بازتابِ آسانبودنِ تفکیکِ مجموعهٔ E از بقیهاند تا نشانهٔ کارآمدیِ روش. آن را برای فهمِ روش به کار ببرید، نه برای ادعای عملکرد.
ارجاع. Andrzejak RG و همکاران (۲۰۰۱)، Physical Review E 64, 061907.
LEMON (MPI Leipzig Mind-Brain-Body)
چیست. برخلافِ دو مجموعهٔ پیشین که بالینی و متمرکز بر صرعاند، LEMON یک مجموعهٔ جمعیتیِ سالم است: ۲۲۸ داوطلبِ سالم در دو گروهِ سنی، با ثبتِ همزمانِ مغز، بدن و سنجههای روانشناختی. هدفِ آن، مطالعهٔ تفاوتهای فردی و اثرِ سالمندی است.
چه دادهای دارد.
- آزمودنیها: گروهِ جوان با ۱۵۴ نفر (۲۰ تا ۳۵ سال) و گروهِ سالمند با ۷۴ نفر (۵۹ تا ۷۷ سال)
- EEGِ حالتِ استراحت: ۶۲ کانال (۶۱ الکترودِ سر بهعلاوهٔ یک کانالِ VEOG)، کلاهِ فعالِ ActiCAP و تقویتکنندهٔ BrainAmp MR plus، نمونهبرداریِ ۲۵۰۰ هرتز با پهنای باندِ ۰٫۰۱۵ هرتز تا ۱ کیلوهرتز، مرجعِ FCz، آرایشِ ۱۰–۱۰. پروتکل: ۱۶ بلوکِ یکدقیقهای، هشت بلوک چشمبسته و هشت بلوک چشمباز بهصورتِ یکدرمیان، با شروع از چشمبسته؛ در مجموع ۱۶ دقیقه
- MRIِ ۳ تسلا: fMRIِ حالتِ استراحت (TR = ۱۴۰۰ میلیثانیه، ۶۵۷ حجم، حدودِ ۱۵٫۵ دقیقه)، MP2RAGE کمّی، T2، FLAIR، SWI/QSM، DWI و نقشههای میدان
- فیزیولوژیِ محیطی: فشارِ خون، ضربان، نبض و تنفس بهصورتِ پیوسته حینِ fMRI
- رفتار و روانسنجی: شش آزمونِ شناختی و ۲۱ پرسشنامه، بهعلاوهٔ نمونهٔ خون و سنجههای تنسنجی
دسترسی. باز و بدونِ محدودیت، با مجوزِ PDDL، از طریقِ سطلِ S3ِ پروژهٔ INDI روی AWS یا صفحههای دانلودِ NITRC.
به چه دردی میخورد. بسامدِ نمونهبرداریِ بالا و مدتِ نسبتاً طولانیِ ثبت، LEMON را برای تحلیلهای نوسانی و طیفی بسیار مناسب میکند: سنجشِ بسامدِ اوجِ آلفا و تغییرِ آن با سن، مقایسهٔ چشمباز و چشمبسته بهعنوانِ یک محکِ ساده و مطمئن برای صحتِ خطِ لولهٔ پردازش، تحلیلِ شیبِ مؤلفهٔ غیرتناوبیِ طیف، و اتصالِ کارکردی میانِ کانالها. وجودِ همزمانِ EEG و MRIِ ساختاری، آن را برای پروژههای بازسازیِ منبع هم گزینهٔ خوبی میکند.
پیوند. صفحهٔ MPI-LEMON · ارجاع: Babayan A و همکاران (۲۰۱۹)، Scientific Data 6, 180308.
دادههای تصویربرداریِ بالینیِ طولی
ADNI (Alzheimer's Disease Neuroimaging Initiative)
چیست. یک مطالعهٔ طولیِ چندمرکزی در آمریکای شمالی که از سالِ ۲۰۰۴ افراد را در طولِ مسیرِ سالمندیِ طبیعی، اختلالِ شناختیِ خفیف (نخست EMCI و سپس LMCI) و در نهایت آلزایمر دنبال میکند. این مطالعه در چند فاز اجرا شده است (ADNI-1، ADNI-GO، ADNI-2 و فازهای بعدی)، و در هر فاز آزمودنیِ تازه هم وارد شده است.
چه دادهای دارد. تصویربرداریِ ساختاری و کارکردی (MRI و انواعِ PET)، نشانگرهای زیستیِ مایعِ مغزی–نخاعی، دادهٔ ژنومی، و مجموعهٔ گستردهای از سنجههای بالینی و شناختی که در بازدیدهای پیاپی تکرار شدهاند. ارزشِ اصلیِ ADNI در همین بُعدِ طولی است: همان فرد در طولِ سالها.
دسترسی. این تنها موردِ فهرستِ ما است که باز نیست. باید در آرشیوِ LONI IDA درخواستِ دسترسی ثبت کنید، وابستگیِ دانشگاهی و طرحِ پژوهشیِ خود را شرح دهید، و توافقنامهٔ استفاده از داده را بپذیرید. کمیتهٔ اشتراکِ داده و انتشاراتِ ADNI معمولاً ظرفِ حدودِ دو هفته درخواستها را بررسی میکند. شرایطِ توافقنامه سختگیرانه است: استفادهٔ تجاری و بازتوزیعِ داده ممنوع است و حساب باید سالانه تمدید شود.
به چه دردی میخورد. برای پرسشهایی که به تغییر در طولِ زمان نیاز دارند: مدلسازیِ سیرِ آتروفی، پیشبینیِ گذار از MCI به آلزایمر، و پیوندِ نشانگرهای زیستی با تغییرِ ساختارِ شبکهٔ مغزی. اگر میخواهید کارِ مدلسازیِ مغزِ کامل انجام دهید و به کانکتومِ فردی نیاز دارید، ADNI یکی از گزینههای اصلی است. توجه کنید که سربارِ کارِ اداری و زمانِ پیشپردازشِ تصویربرداری در این پروژهها قابلِتوجه است؛ آن را در برنامهریزیِ خود لحاظ کنید.
پیوند. صفحهٔ دسترسی به دادهٔ ADNI
درگاهها: جایی که دادهٔ بعدی را پیدا میکنید
فهرستِ بالا شش نمونهٔ منتخب است، نه یک سیاههٔ کامل. وقتی پرسشِ پژوهشیِ مشخصی دارید، معمولاً بهتر است بهجای جستوجوی مستقیم، سراغِ درگاههایی بروید که مجموعههای بسیاری را یکجا میزبانی میکنند:
| درگاه | چه چیزی میزبانی میکند |
|---|---|
| PhysioNet | سیگنالهای زیستپزشکی: EEG، ECG، دادههای ICU و بالینی؛ منبعِ CHB-MIT |
| OpenNeuro | تصویربرداریِ مغز در قالبِ استانداردِ BIDS: MRI، MEG، EEG، iEEG |
| DANDI | الکتروفیزیولوژی و تصویربرداریِ سلولی در قالبِ NWB |
| CRCNS | دادگانهای کلاسیکِ علوم اعصابِ محاسباتی، بسیاری با مقالهٔ تحلیلیِ همراه |
| NITRC | ابزارها و دادگانهای تصویربرداریِ عصبی؛ میزبانِ LEMON |
| Registry of Open Data on AWS | نسخهٔ ابریِ مجموعههای بزرگ، از جمله IBL و Allen |
دو استانداردِ قالبِ داده هم ارزشِ شناختن دارند، چون هرچه جلوتر بروید بیشتر با آنها روبهرو میشوید: BIDS برای سازماندهیِ پوشهها و فرادادهٔ مطالعاتِ تصویربرداری، و NWB برای فایلهای الکتروفیزیولوژی. اگر دادهٔ خودتان را روزی منتشر کنید، پیروی از این استانداردها بزرگترین لطفی است که به کاربرانِ بعدی (که یکی از آنها احتمالاً خودِ شما در دو سالِ آینده است) میکنید.
اخلاق، مجوز و بازتولیدپذیری
سه نکته که در کارِ با دادهٔ منتشرشده باید همیشه در نظر داشت.
مجوز را بخوانید و رعایت کنید. مجوزها یکسان نیستند. PDDL (مانندِ LEMON) عملاً داده را به مالکیتِ عمومی میسپارد؛ ODC-BY (مانندِ CHB-MIT) ارجاع را الزامی میکند؛ و توافقنامههای استفاده از داده (مانندِ ADNI) بازتوزیع و کاربردِ تجاری را ممنوع میکنند. اگر مطمئن نیستید، پیش از انتشارِ نتیجه بررسی کنید.
دادهٔ انسانی را بازشناسایی نکنید. حتی وقتی داده ناشناسسازی شده است، تلاش برای پیوندزدنِ آن به هویتِ افراد نقضِ آشکارِ شرایطِ استفاده و اخلاقِ پژوهش است. همچنین توجه کنید که تصویرِ ساختاریِ مغز بهخودیِخود میتواند شناساییکننده باشد؛ به همین دلیل مجموعههایی مانندِ LEMON نقابِ صورتزدایی (defacemask) دارند.
نسخهٔ داده را ثبت کنید. پایگاهها بهروزرسانی میشوند: اسپایکسورتینگِ IBL چند بار بازنگری شده و برچسبهای بالینی هم گاهی اصلاح میشوند. اگر در گزارشِ خود ننویسید که از کدام نسخه و کدام تاریخِ دانلود استفاده کردهاید، نتیجهٔ شما بازتولیدپذیر نیست. این همان اصلی است که در پیوستِ طراحی گردشکار و آزمایش محاسباتی دربارهٔ فراداده گفتیم؛ فقط اینجا فراداده به دادهای اشاره میکند که خودتان تولیدش نکردهاید.
جمعبندی در یک جدول
| پایگاه | مقیاس | گونه | دسترسی | مناسب برای |
|---|---|---|---|---|
| IBL | اسپایک + LFP | موش | باز، ONE-api | کدگذاریِ جمعیتی، تصمیمگیری، جفتشدگیِ اسپایک–فاز |
| Allen Brain Observatory | اسپایک + کلسیم | موش | باز، AllenSDK | کدگذاریِ حسی، انواعِ سلولی، برازشِ مدلِ نورونی |
| CHB-MIT | EEGِ سطحی، ۲۵۶ هرتز | انسان | باز، PhysioNet | آشکارسازی و پیشبینیِ تشنج |
| Bonn | EEGِ سطحی و درونجمجمهای، ۱۷۳٫۶ هرتز | انسان | باز، UPF | تحلیلِ غیرخطیِ سریهای زمانی، تمرینِ روش |
| LEMON | EEGِ ۲۵۰۰ هرتزی + MRI | انسان | باز، PDDL | نوساناتِ حالتِ استراحت، سالمندی، بازسازیِ منبع |
| ADNI | MRI، PET، CSF، ژنوم | انسان | با درخواست و توافقنامه | مطالعاتِ طولی، پیشبینیِ سیرِ بیماری |
تمرینها
تمرینِ ۱. فرض کنید میخواهید بررسی کنید که آیا توانِ باندِ گاما (۳۰ تا ۸۰ هرتز) پیش از شروعِ تشنج تغییر میکند. از میانِ CHB-MIT و Bonn کدامیک برای این پرسش مناسب است و چرا؟
پاسخ
از نظرِ بسامدِ نمونهبرداری، هر دو از پسِ باندِ گاما برمیآیند: CHB-MIT با ۲۵۶ هرتز نایکوئیستِ ۱۲۸ هرتز دارد و Bonn با ۱۷۳٫۶۱ هرتز نایکوئیستِ حدودِ ۸۷ هرتز؛ هر دو بالای ۸۰ هرتز هستند، هرچند Bonn دقیقاً روی لبه است و بهعلاوه با فیلترِ میانگذرِ ۰٫۵۳ تا ۴۰ هرتز ثبت شده، پس عملاً بالای ۴۰ هرتز محتوایی ندارد.
اما مسئلهٔ تعیینکننده بسامد نیست، بلکه ساختارِ زمانیِ داده است. پرسشِ شما دربارهٔ تغییر در آستانهٔ تشنج است، یعنی به ثبتِ پیوستهای نیاز دارید که دقایق یا ساعتهای پیش از تشنج را در بر بگیرد و لحظهٔ شروعِ تشنج در آن برچسب خورده باشد. Bonn قطعههای ۲۳٫۶ ثانیهایِ جدا از هم و تصادفیشده است؛ اصلاً «پیش از تشنج» در آن تعریف نمیشود. CHB-MIT دقیقاً برای همین ساخته شده است: ثبتِ چندروزه با حاشیهنویسیِ زمانِ آغاز و پایانِ هر تشنج.
تمرینِ ۲. میخواهید بررسی کنید که آیا نورونهای یک ناحیه پیش از حرکتِ حیوان فعالیتشان تغییر میکند. کدامیک از پایگاههای این فصل دادهای دارد که این پرسش را ممکن کند، و دقیقاً به کدام دو لایهٔ داده نیاز دارید؟
پاسخ
IBL. به دو لایه نیاز دارید که باید بر یک محورِ زمانیِ مشترک همتراز شده باشند: نخست زمانِ اسپایکها بههمراه نسبتدادنِ هر واحد به ناحیهٔ آناتومیک، و دوم دادهٔ رفتاری، بهویژه موقعیتِ لحظهایِ چرخ که آغازِ حرکت را مشخص میکند (یا زمانِ واکنشِ ثبتشده در دادهٔ آزمایشها).
دادهٔ Allen Brain Observatory در شاخهٔ Visual Coding این پرسش را بهشکلِ کامل پاسخ نمیدهد، چون آنجا حیوان تکلیفِ تصمیمگیری ندارد و فقط محرکِ بینایی میبیند؛ هرچند سرعتِ دویدن روی چرخ ثبت میشود و میتوان نسخهٔ محدودتری از پرسش را طرح کرد. شاخهٔ Visual Behavior برای پرسشهای رفتاری مناسبتر است.
تمرینِ ۳. دو گروهِ پژوهشی روی CHB-MIT کار میکنند. گروهِ اول دقتِ ۹۹٫۲ درصد و گروهِ دوم دقتِ ۷۶ درصد گزارش میکند. چرا ممکن است عددِ کوچکترِ گروهِ دوم ارزشِ علمیِ بیشتری داشته باشد؟
پاسخ
چون عدد بدونِ طرحِ ارزیابی بیمعناست. اگر گروهِ اول پنجرهها را تصادفی میانِ آموزش و آزمون تقسیم کرده باشد، پنجرههای همسایه از یک تشنجِ واحد در هر دو مجموعه حاضرند و مدل بهجای یادگیریِ الگویِ عمومیِ تشنج، امضایِ همان تشنجِ خاص را حفظ میکند. این نشتِ داده است و عددِ حاصل روی بیمارِ تازه تکرار نمیشود.
اگر گروهِ دوم ارزیابیِ «یک بیمار بیرونگذاشته» (leave-one-patient-out) انجام داده باشد، ۷۶ درصدِ او تخمینی صادقانه از عملکرد روی بیمارِ ندیده است. مقایسهٔ دو عدد بدونِ دانستنِ این موضوع، مقایسهٔ دو چیزِ متفاوت است. همین نکته دلیلِ آن است که در فصلِ راستیآزمایی و اعتبارسنجی بر تفکیکِ روشنِ داده تأکید کردیم.
منابع
- IBL و همکاران (۲۰۲۵)، A brain-wide map of neural activity during complex behaviour, Nature. https://www.nature.com/articles/s41586-025-09235-0
- Guttag J (۲۰۱۰)، CHB-MIT Scalp EEG Database, PhysioNet. https://doi.org/10.13026/C2K01R
- Andrzejak RG، Lehnertz K، Rieke C، Mormann F، David P، Elger CE (۲۰۰۱)، Indications of nonlinear deterministic and finite dimensional structures in time series of brain electrical activity, Phys. Rev. E 64, 061907.
- Babayan A و همکاران (۲۰۱۹)، A mind-brain-body dataset of MRI, EEG, cognition, emotion, and peripheral physiology in young and old adults, Scientific Data 6, 180308.
- Allen Institute for Brain Science، Allen Brain Map. https://brain-map.org/
- Alzheimer's Disease Neuroimaging Initiative. https://adni.loni.usc.edu/