پرش به محتویات

پیوست: پایگاه‌های دادهٔ باز در علوم اعصاب

تا اینجای کتاب، تقریباً همهٔ داده‌هایی که با آن‌ها کار کردیم را خودمان ساخته بودیم: از یک نوسانگر انتگرال گرفتیم، یک نورون هاجکین–هاکسلی را شبیه‌سازی کردیم، یا نوفه‌ای مصنوعی به سیگنال افزودیم. این کار برای یادگیریِ روش‌ها ایده‌آل است، چون پاسخِ درست را از پیش می‌دانیم. اما پژوهشِ واقعی جای دیگری است: در آنجا داده از مغزِ یک موش یا یک انسان می‌آید، پاسخِ درست را کسی نمی‌داند، و بخشِ بزرگی از کار صرفِ فهمیدنِ این می‌شود که داده اصلاً چیست و چگونه ثبت شده است.

خبرِ خوب این است که برای شروع لازم نیست آزمایشگاه داشته باشید. در دو دههٔ گذشته، جامعهٔ علوم اعصاب مقدارِ چشمگیری داده را آزادانه منتشر کرده است: از اسپایکِ صدها هزار نورونِ ثبت‌شده با نوروپیکسل تا EEGِ بیمارانِ صرعی و تصویربرداریِ طولیِ هزاران فرد. این پیوست فهرستی است از پایگاه‌هایی که برای شروعِ یک پروژهٔ محاسباتی مناسب‌اند، همراه با اینکه هر کدام دقیقاً چه چیزی دارند و به دردِ چه پرسشی می‌خورند.

این پیوست کد ندارد

اینجا فقط معرفی و نقشهٔ راه است. نحوهٔ بارگذاری و پیش‌پردازشِ عملیِ هر یک از این داده‌ها موضوعِ پیوست‌های جداگانه‌ای است که به‌تدریج افزوده می‌شوند. آنچه در این صفحه می‌خوانید، برای این است که پیش از نوشتنِ نخستین خطِ کد بدانید سراغِ کدام داده بروید و چرا.

پیش از انتخابِ داده: شش پرسش

پیش از آنکه گیگابایت‌ها داده دانلود کنید، خوب است این شش پرسش را دربارهٔ هر پایگاه از خودتان بپرسید. پاسخ به این‌ها معمولاً چند ساعت وقت می‌گیرد و چند هفته وقت نجات می‌دهد.

  1. مقیاسِ ثبت چیست؟ داده در چه سطحی از سازمان‌یافتگیِ مغز ثبت شده است؟ اسپایکِ تک‌نورون، پتانسیلِ میدانیِ موضعی (LFP)، EEGِ سطحِ پوستِ سر، یا سیگنالِ همودینامیکِ fMRI؟ این انتخاب تعیین می‌کند که چه پرسشی اصلاً قابلِ‌طرح است. با EEGِ ۲۳ کاناله نمی‌توان دربارهٔ کدگذاریِ تک‌نورون حرف زد، و با ثبتِ نوروپیکسل در قشرِ بینایی موش نمی‌توان دربارهٔ شبکه‌های کلانِ مغزِ انسان.

  2. بسامدِ نمونه‌برداری و پهنای باند چقدر است؟ این را در فصلِ پردازش سیگنال در حوزهٔ فرکانس دیدیم: بسامدِ نایکوئیست سقفِ آنچه را که می‌توانید ببینید تعیین می‌کند. دادهٔ ۱۷۳ هرتزی هرگز به شما دربارهٔ نوساناتِ گاما بالای ۸۰ هرتز چیزِ قابلِ‌اعتمادی نمی‌گوید.

  3. برچسب‌گذاری چگونه است؟ آیا رویدادها (تشنج، محرک، پاسخِ رفتاری) با دقتِ زمانی مشخص‌اند؟ چه کسی و با چه معیاری برچسب زده است؟ در دادهٔ بالینی، برچسب‌ها معمولاً حاصلِ قضاوتِ چند متخصص‌اند و خودشان عدمِ‌قطعیت دارند.

  4. حجم و ساختارِ فایل‌ها چیست؟ یک مجموعهٔ ۲ مگابایتیِ متنی را روی لپ‌تاپ باز می‌کنید؛ یک مجموعهٔ ۴۰ گیگابایتی نیازمندِ برنامه‌ریزی برای فضای دیسک و زمانِ دانلود است؛ و مجموعه‌های چند ترابایتی را اصلاً دانلود نمی‌کنند، بلکه با دسترسیِ ابری و الگوریتم‌های بارگذاریِ تنبل (lazy loading) می‌خوانند.

  5. مجوز و شرایطِ دسترسی چیست؟ برخی داده‌ها کاملاً باز و بدونِ ثبت‌نام‌اند؛ برخی نیازمندِ ساختِ حساب‌اند؛ و برخی نیازمندِ درخواستِ رسمی، تأییدِ کمیته و امضای توافق‌نامهٔ استفاده از داده‌اند. این تفاوت می‌تواند چند هفته به زمان‌بندیِ پروژه اضافه کند.

  6. چگونه باید ارجاع داده شود؟ تقریباً همهٔ این پایگاه‌ها مقالهٔ مرجعی دارند که استفاده از داده مستلزمِ ارجاع به آن است. این یک تشریفات نیست: کارِ کسانی که سال‌ها صرفِ ثبت و انتشارِ داده کرده‌اند تنها از همین راه دیده می‌شود.


داده‌های الکتروفیزیولوژی حیوانی

International Brain Laboratory (IBL)

چیست. یک همکاریِ بین‌المللیِ بزرگ که در آن ده‌ها آزمایشگاه، یک تکلیفِ رفتاریِ یکسان را روی موش اجرا کرده‌اند و در حینِ آن با کاوشگرهای نوروپیکسل (Neuropixels) از سراسرِ مغز ثبت گرفته‌اند. تکلیف، یک تصمیم‌گیریِ بینایی است: در هر آزمایش یک گِرِیتینگ (grating؛ الگویی از نوارهای روشن و تاریکِ متناوب، که محرکِ استانداردِ پژوهش‌های بینایی است) در سمتِ چپ یا راستِ صفحه ظاهر می‌شود و موش باید چرخی را بچرخاند تا آن را به مرکزِ صفحه بیاورد. کنتراستِ گِرِیتینگ، یعنی اختلافِ روشناییِ نوارهای روشن و تاریکِ آن، از آزمایشی به آزمایشِ دیگر تغییر می‌کند: در کنتراستِ بالا تشخیص آسان است و در کنتراستِ نزدیک به صفر، حیوان عملاً حدس می‌زند. همین تغییرِ کنتراست است که تکلیف را به آزمونی برای تصمیم‌گیری در شرایطِ عدمِ‌قطعیت بدل می‌کند، نه صرفاً یک پاسخِ حسیِ ساده.

نکتهٔ کلیدیِ IBL این است که استانداردسازیِ پروتکل، مقایسهٔ میان آزمایشگاه‌ها را ممکن می‌کند؛ چیزی که در علوم اعصاب کمیاب است.

چه داده‌ای دارد. انتشارِ «نقشهٔ سراسریِ مغز» (Brain Wide Map) شاملِ ۴۵۹ نشستِ ثبت (session؛ یک جلسهٔ ثبت از یک حیوان در یک روز، از آغاز تا پایانِ کارِ آن روز) با ۶۹۹ فروبردنِ کاوشگر (insertion؛ هر بار که یک کاوشگر در مغز فرو می‌رود، چون در یک نشست ممکن است چند کاوشگر هم‌زمان کار بگذارند) در ۱۳۹ موش از ۱۲ آزمایشگاه و پوششِ ۲۴۱ ناحیهٔ مغزی است. در مجموع ۶۲۱٬۷۳۳ واحد شناسایی شده که از این میان ۷۵٬۷۰۸ واحد معیارهای کنترلِ کیفیت را می‌گذرانند.

چرا «واحد» و نه «نورون»؟

الکترود ولتاژ را ثبت می‌کند، نه هویتِ سلول‌ها را. هر الکترود اسپایکِ چند نورونِ همسایه را با هم می‌بیند، و الگوریتمِ اسپایک‌سورتینگ باید این اسپایک‌ها را بر پایهٔ شکلِ موجشان به خوشه‌هایی تفکیک کند. به هر خوشه یک واحد (unit) می‌گویند: مجموعه‌ای از اسپایک‌ها که احتمالاً از یک نورونِ واحد آمده‌اند. این «احتمالاً» مهم است. یک واحد ممکن است در واقع اسپایکِ دو نورون باشد که به هم چسبیده‌اند، یا برعکس، اسپایک‌های یک نورون میانِ دو واحد تقسیم شده باشد. به همین دلیل واحدها را با معیارهای کنترلِ کیفیت غربال می‌کنند، و در IBL از ۶۲۱٬۷۳۳ واحدِ خام تنها ۷۵٬۷۰۸ واحد از این غربال می‌گذرند. در تحلیل‌های خود همیشه مشخص کنید که با کدام مجموعه کار می‌کنید.

هر نشست چند لایهٔ داده دارد:

  • زمانِ اسپایک‌ها پس از اسپایک‌سورتینگ، به‌همراه شناسهٔ واحد، ناحیهٔ آناتومیکِ نسبت‌داده‌شده و معیارهای کیفیت
  • شکلِ موجِ اسپایک‌ها برای هر واحد
  • سیگنالِ خام در دو باند: باندِ AP (پتانسیلِ عمل) و باندِ LFP
  • دادهٔ رفتاری: زمان‌بندیِ آزمایش‌ها، محرک، پاسخ، زمانِ واکنش و موقعیتِ لحظه‌ایِ چرخ
  • ویدئو از چهره و بدنِ حیوان به‌همراه موقعیتِ نقاطِ کلیدی از تحلیلِ DeepLabCut

دسترسی. با کتابخانهٔ پایتونیِ ONE-api (Open Neurophysiology Environment). پایگاهِ عمومی روی openalyx.internationalbrainlab.org قرار دارد و با نامِ کاربریِ intbrainlab و گذرواژهٔ international باز است؛ یعنی عملاً بدونِ نیاز به ثبت‌نام. داده روی AWS نیز قرار داده شده است. کارِ ONE این است که به‌جای دانلودِ کلِ مجموعه، فقط همان فایل‌هایی را که می‌خواهید (مثلاً اسپایک‌های یک کاوشگر در یک نشست) بگیرد و کَش (cache) کند.

به چه دردی می‌خورد. این بهترین نقطهٔ شروع برای پرسش‌هایی است که به اسپایکِ تک‌نورون در بافتارِ رفتار نیاز دارند: ساختنِ راستِرپلات و منحنیِ تنظیم، سنجشِ همبستگیِ نوفه میان جفت‌نورون‌ها، رمزگشاییِ تصمیمِ حیوان از فعالیتِ جمعیت، یا مقایسهٔ تأخیرِ پاسخ میان نواحیِ مغزی. چون باندِ LFP هم موجود است، می‌توان تحلیل‌های زمان–بسامدِ فصلِ تحلیل زمان–بسامد را روی دادهٔ واقعی تمرین کرد و مثلاً جفت‌شدگیِ اسپایک به فازِ نوسانِ LFP را سنجید.

پیوندها. شروعِ سریع با ONE · نمونه‌های بارگذاریِ داده · مقالهٔ مرجع: IBL و همکاران، Nature (۲۰۲۵)، DOI

Allen Brain Observatory

چیست. مجموعه‌ای از دادگان‌های استانداردشده از مؤسسهٔ Allen که فعالیتِ قشرِ بینایی موش را در پاسخ به یک کتابخانهٔ ثابت از محرک‌های بینایی ثبت کرده است. دو شاخهٔ اصلی دارد که مکملِ یکدیگرند.

«تراریخته» و «ردهٔ Cre» یعنی چه؟

حیوانِ تراریخته (transgenic) حیوانی است که ژنی به‌عمد به ژنومش افزوده شده است. در علوم اعصاب، معمول‌ترین کاربردِ آن این است که بتوانیم یک ردهٔ ژنتیکیِ مشخص از سلول‌ها را نشان‌دار کنیم.

ابزارِ متداولِ این کار سامانهٔ Cre-lox است. Cre آنزیمی است که DNA را در نقاطِ نشانه‌داری به نامِ loxP می‌بُرد و بازترکیب می‌کند. در یک ردهٔ Cre، ژنِ این آنزیم چنان کار گذاشته می‌شود که فقط در سلول‌هایی بیان شود که ژنِ معینی را روشن کرده‌اند؛ مثلاً Pvalb-IRES-Cre یعنی Cre تنها در نورون‌هایی ساخته می‌شود که پروتئینِ پارووالبومین می‌سازند، و اینها زیرگونه‌ای شناخته‌شده از نورون‌های مهاری‌اند. سپس این حیوان با یک ردهٔ گزارشگر آمیخته می‌شود که ژنِ یک پروتئینِ فلورسان یا یک حسگرِ کلسیمی مانندِ GCaMP را دارد، اما این ژن پشتِ یک قطعهٔ «توقف» میانِ دو loxP قفل شده است. هرجا Cre باشد، قفل برداشته می‌شود.

نتیجه این است که فقط همان ردهٔ سلولیِ هدف حسگر را بیان می‌کند. برای همین در دادهٔ Allen می‌دانید هر ردِ فعالیت به کدام نوعِ سلولی تعلق دارد، و این چیزی است که ثبتِ الکتریکیِ معمولی به شما نمی‌دهد. در ثبت‌های الکتریکی هم از همین ترفند استفاده می‌شود، با این تفاوت که ژنِ گزارشگر یک کانالِ نوری (مانندِ ردهٔ گزارشگرِ Ai32) است: با تاباندنِ نور می‌توان همان سلول‌ها را فعال کرد و از روی پاسخشان هویتشان را در میانِ صدها واحدِ ثبت‌شده بازشناخت.

تصویربرداریِ کلسیمیِ دوفوتونی (Visual Coding 2P). بیش از ۶۳٬۰۰۰ نورون در ۱۴ ردهٔ تراریختهٔ Cre، شش ناحیهٔ بیناییِ قشری (VISp و پنج ناحیهٔ بالاتر) و چهار عمقِ قشری. محرک‌ها شاملِ گِرِیتینگ، نوفهٔ تُنُکِ موضعی، صحنه‌های طبیعی و فیلم‌های طبیعی‌اند. مزیتِ این شاخه، هویتِ سلولیِ مشخص است: می‌دانید هر ردِ فعالیت به کدام نوعِ سلولی و کدام لایه تعلق دارد. عیبش، وضوحِ زمانیِ پایین و غیرمستقیم‌بودنِ سیگنالِ کلسیم نسبت به اسپایک است.

ثبتِ نوروپیکسل (Visual Coding Neuropixels). نزدیک به ۱۰۰٬۰۰۰ نورون از موش‌های نوعِ وحشی (wild-type، یعنی بدونِ دست‌کاریِ ژنتیکی) و سه ردهٔ تراریخته، با ثبتِ هم‌زمان از نواحیِ بیناییِ قشری، تالاموس (LGN و LP) و هیپوکامپ. دو مجموعهٔ محرکی دارد: یکی هم‌ارزِ محرک‌های شاخهٔ دوفوتونی برای مقایسهٔ مستقیمِ دو روش، و دیگری با محرک‌های تکراری برای تحلیلِ اتصالِ کارکردیِ میان‌ناحیه‌ای.

پایگاهِ انواعِ سلولی و ریخت‌شناسیِ سه‌بعدی (Cell Types Database). این شاخه با دو شاخهٔ بالا فرق دارد: موضوعش نه پاسخِ جمعیتی به محرک، بلکه خودِ تک‌نورون است. از هر سلول در برشِ مغزی با روشِ پچ‌کلمپِ تمام‌سلولی ثبت می‌گیرند و در حینِ ثبت آن را با بیوسیتین پر می‌کنند؛ سپس سلولِ رنگ‌گرفته را لایه‌به‌لایه تصویربرداری و به‌صورتِ سه‌بعدی بازسازی می‌کنند. خروجی برای هر سلول سه چیز است که به هم گره خورده‌اند: پاسخِ الکتریکی به پروتکل‌های استاندارد (پله‌های بلند، پالس‌های کوتاه، شیب‌های آهسته و نوفهٔ طبیعی‌نما)، ریخت‌شناسیِ سه‌بعدی در قالبِ فایلِ SWC، و در بسیاری موارد نیمرخِ بیانِ ژن. داده هم از موش و هم از بافتِ انسانی موجود است. افزون بر داده، مدل‌های آماده هم منتشر شده‌اند: مدل‌های GLIF (انتگرال‌گیر-و-آتشِ نشت‌دارِ تعمیم‌یافته) و مدل‌های بیوفیزیکی در دو نسخهٔ پیراسومایی (دندریتِ غیرفعال، سومای فعال) و تمام-فعال، که پارامترهایشان به همان سلولِ ثبت‌شده برازش خورده است.

فایلِ SWC چیزی جز یک جدولِ متنی نیست: هر سطر یک نقطه روی درختِ نورون است با مختصاتِ سه‌بعدی، شعاع، نوعِ بخش (سوما، دندریت، آکسون) و شناسهٔ نقطهٔ والد. همین ساختارِ ساده کافی است تا شبیه‌سازها هندسهٔ واقعیِ سلول را بازبسازند و آن را به مدلِ تقسیمی (compartmental) تبدیل کنند؛ یعنی دقیقاً همان کاری که در فصلِ کابل و مدل‌های تقسیمی به‌صورتِ نظری دیدیم. ابزارِ متعارفِ این کار NEURON است، و NetPyNE که روی NEURON سوار می‌شود و به شما اجازه می‌دهد شبکه‌ای از همین سلول‌های تفصیلی را با یک توصیفِ اعلانی بسازید، به‌صورتِ موازی اجرا کنید و تحلیل کنید. AllenSDK نیز مدل‌های بیوفیزیکیِ آماده را با موتورِ NEURON اجرا می‌کند.

اهمیتِ عملیِ این پایگاه در همین‌جاست: تا وقتی با نورونِ نقطه‌ای کار می‌کنید، هندسه اهمیتی ندارد. اما به‌محضِ آنکه بخواهید بپرسید ورودیِ سیناپسی روی دندریتِ دور چقدر تضعیف می‌شود، یا یک شاخهٔ دندریتی کِی خودش رویداد فعال تولید می‌کند، به هندسهٔ واقعی نیاز دارید و ساختنِ آن از روی حدس بی‌معناست. اگر ریخت‌شناسیِ گونه یا ناحیهٔ دیگری می‌خواهید، NeuroMorpho.Org بزرگ‌ترین آرشیوِ تجمیعیِ بازسازی‌های سه‌بعدی از آزمایشگاه‌های سراسرِ دنیا است و آن هم بر همان قالبِ SWC استوار است.

دسترسی. با کتابخانهٔ AllenSDK در پایتون؛ فایل‌ها در قالبِ NWB (Neurodata Without Borders) هستند و روی AWS هم در دسترس‌اند. پایگاهِ Cell Types نیز از راهِ همین SDK و APIِ Allen در دسترس است. مؤسسهٔ Allen منابعِ دیگری هم دارد که ارزشِ شناختن دارند: اطلسِ اتصالاتِ موش و اطلس‌های مرجعِ آناتومیک.

به چه دردی می‌خورد. چون محرک‌ها استاندارد و کتابخانه‌ای‌اند، این داده برای پرسش‌های کدگذاریِ حسی ایده‌آل است: منحنیِ تنظیمِ جهت و بسامدِ فضایی، سلسله‌مراتبِ نواحیِ بینایی، تفاوتِ پاسخِ زیرگونه‌های مهاری، و مقایسهٔ آنچه یک مدل پیش‌بینی می‌کند با آنچه واقعاً ثبت شده است. پایگاهِ Cell Types هم پلی است میانِ بیوفیزیکِ فصلِ غشا و پارامترهای واقعیِ نورون: با ردهای الکتریکیِ آن می‌توان مدل‌های هاجکین–هاکسلی و LIF و AdEx را به دادهٔ یک سلولِ مشخص برازش داد، و با فایل‌های SWC همان سلول را به‌صورتِ گسترده در فضا شبیه‌سازی کرد.

پیوندها. پورتالِ Allen Brain Map · پایگاهِ Cell Types · مستنداتِ AllenSDK · مدل‌های بیوفیزیکی در AllenSDK


داده‌های EEG انسانی

CHB-MIT Scalp EEG Database

چیست. ثبتِ طولانی‌مدتِ EEGِ پوستِ سر از کودکان و نوجوانانِ مبتلا به تشنجِ مقاوم به دارو، جمع‌آوری‌شده در بیمارستانِ کودکانِ بوستون. بیماران برای ارزیابیِ جراحی، داروی ضدتشنجِ خود را قطع کرده بودند و چند روز پیوسته تحتِ پایش بودند؛ به همین دلیل این مجموعه هم دوره‌های طولانیِ بین‌تشنجی دارد و هم تشنج‌های واقعی.

چه داده‌ای دارد.

  • ۲۲ فرد مورد آزمایش در قالبِ ۲۳ پرونده (۵ پسر ۳ تا ۲۲ ساله، ۱۷ دختر ۱٫۵ تا ۱۹ ساله)
  • ۶۶۴ فایلِ .edf، در مجموع حدودِ ۴۲٫۶ گیگابایت
  • ۱۹۸ تشنج که آغاز و پایانِ هر یک در فایل‌های حاشیه‌نویسیِ .seizure مشخص شده است؛ ۱۲۹ فایل دستِ‌کم یک تشنج دارند
  • بسامدِ نمونه‌برداری ۲۵۶ هرتز، تفکیکِ ۱۶ بیت، معمولاً ۲۳ کانال (در برخی پرونده‌ها ۲۴ یا ۲۶) بر پایهٔ سیستم ۱۰–۲۰؛ برخی ثبت‌ها کانالِ ECG یا سیگنالِ تحریکِ عصبِ واگ هم دارند
  • بیشترِ فایل‌ها یک‌ساعته‌اند؛ چند پرونده فایل‌های دو یا چهارساعته دارند

دسترسی. کاملاً باز، بدونِ ثبت‌نام، از PhysioNet؛ با مجوزِ Open Data Commons Attribution v1.0. می‌توان کلِ مجموعه را با wget یا با ابزارِ wfdb گرفت.

به چه دردی می‌خورد. این متداول‌ترین محکِ عمومی برای آشکارسازی و پیش‌بینیِ تشنج است، و برای همین هم نقطهٔ قوت و هم دامِ اصلیِ آن همین‌جاست. کارهای ساده و آموزنده: مقایسهٔ چگالیِ طیفیِ توان در پنجره‌های تشنجی و بین‌تشنجی، ردیابیِ گسترشِ تشنج روی کانال‌ها، و سنجشِ هم‌زمانیِ میان‌کاناله در آستانهٔ تشنج، که مستقیماً به مفاهیمِ فصل‌های فیلترها و تحلیل زمان–بسامد وصل می‌شود.

دامِ ارزیابی

اگر پنجره‌های آموزش و آزمون را به‌صورتِ تصادفی از کلِ داده انتخاب کنید، پنجره‌های مجاور از یک تشنجِ واحد در هر دو مجموعه می‌افتند و مدل عملاً همان تشنج را «به‌خاطر می‌سپارد». نتیجه دقتِ ۹۹ درصدی است که هیچ معنایی ندارد. تقسیم باید در سطحِ بیمار یا دستِ‌کم در سطحِ تشنج انجام شود. بسیاری از مقالاتِ منتشرشده روی این داده دقیقاً همین اشتباه را دارند.

پیوند. صفحهٔ داده در PhysioNet · ارجاع: Guttag, J. (2010), PhysioNet، DOI: 10.13026/C2K01R

Bonn EEG Dataset

چیست. مجموعهٔ کلاسیکی که Andrzejak و همکارانش در دانشگاهِ بُن در سالِ ۲۰۰۱ منتشر کردند. برخلافِ مجموعه‌های امروزی، این داده کوچک، تمیز و از پیش قطعه‌بندی‌شده است و دقیقاً به همین دلیل هنوز مفید است: می‌توان آن را در چند ثانیه در حافظه بارگذاری کرد و روی آن روش‌ها را آزمود.

چه داده‌ای دارد. پنج مجموعه، هر یک با ۱۰۰ قطعهٔ تک‌کاناله. هر قطعه ۴۰۹۶ نمونه با بسامدِ نمونه‌برداریِ ۱۷۳٫۶۱ هرتز دارد، یعنی حدودِ ۲۳٫۶ ثانیه، و در قالبِ فایلِ متنیِ ساده ذخیره شده است. طبقِ مقالهٔ اصلی، ثبت با تفکیکِ ۱۲ بیت و فیلترِ میان‌گذرِ ۰٫۵۳ تا ۴۰ هرتز انجام شده است.

مجموعه نامِ فایل منبع وضعیت
A Z EEGِ سطحی، ۵ داوطلبِ سالم چشم‌بازِ آرام
B O EEGِ سطحی، همان داوطلبان چشم‌بسته
C N ثبتِ درون‌جمجمه‌ای، بیمارانِ صرعی بین‌تشنجی، نیم‌کرهٔ مقابلِ کانون
D F ثبتِ درون‌جمجمه‌ای، همان بیماران بین‌تشنجی، داخلِ ناحیهٔ صرع‌زا
E S ثبتِ درون‌جمجمه‌ای، همان بیماران حینِ تشنج

دسترسی. فایل‌های zip به‌صورتِ عمومی از صفحهٔ گروهِ تحلیلِ سری‌های زمانیِ غیرخطیِ UPF قابلِ دانلودند. حجمِ کل چند مگابایت است.

به چه دردی می‌خورد. این بهترین دادهٔ تمرینی در این فهرست است. چون قطعه‌ها هم‌طول و برچسب‌دارند، می‌توانید بی‌درنگ سراغِ خودِ روش بروید: طیفِ توان، آنتروپیِ نمونه‌ای، بُعدِ همبستگی، بیشترین نمایِ لیاپانوف و بازسازیِ فضای فاز. توجه کنید که این داده تاریخاً محکِ اصلیِ تحلیلِ غیرخطیِ سری‌های زمانی بوده است، و مستقیماً به فصلِ سیستم‌های غیرخطی و نظریهٔ آشوب وصل می‌شود.

کوچک‌بودن هم عیب است

۵۰۰ قطعه از تعدادِ اندکی آزمودنی، برای آموزشِ مدل‌های یادگیریِ عمیق کافی نیست. دقت‌های نزدیک به ۱۰۰ درصد که در ادبیاتِ این داده فراوان‌اند، بیشتر بازتابِ آسان‌بودنِ تفکیکِ مجموعهٔ E از بقیه‌اند تا نشانهٔ کارآمدیِ روش. آن را برای فهمِ روش به کار ببرید، نه برای ادعای عملکرد.

ارجاع. Andrzejak RG و همکاران (۲۰۰۱)، Physical Review E 64, 061907.

LEMON (MPI Leipzig Mind-Brain-Body)

چیست. برخلافِ دو مجموعهٔ پیشین که بالینی و متمرکز بر صرع‌اند، LEMON یک مجموعهٔ جمعیتیِ سالم است: ۲۲۸ داوطلبِ سالم در دو گروهِ سنی، با ثبتِ هم‌زمانِ مغز، بدن و سنجه‌های روان‌شناختی. هدفِ آن، مطالعهٔ تفاوت‌های فردی و اثرِ سالمندی است.

چه داده‌ای دارد.

  • آزمودنی‌ها: گروهِ جوان با ۱۵۴ نفر (۲۰ تا ۳۵ سال) و گروهِ سالمند با ۷۴ نفر (۵۹ تا ۷۷ سال)
  • EEGِ حالتِ استراحت: ۶۲ کانال (۶۱ الکترودِ سر به‌علاوهٔ یک کانالِ VEOG)، کلاهِ فعالِ ActiCAP و تقویت‌کنندهٔ BrainAmp MR plus، نمونه‌برداریِ ۲۵۰۰ هرتز با پهنای باندِ ۰٫۰۱۵ هرتز تا ۱ کیلوهرتز، مرجعِ FCz، آرایشِ ۱۰–۱۰. پروتکل: ۱۶ بلوکِ یک‌دقیقه‌ای، هشت بلوک چشم‌بسته و هشت بلوک چشم‌باز به‌صورتِ یک‌درمیان، با شروع از چشم‌بسته؛ در مجموع ۱۶ دقیقه
  • MRIِ ۳ تسلا: fMRIِ حالتِ استراحت (TR = ۱۴۰۰ میلی‌ثانیه، ۶۵۷ حجم، حدودِ ۱۵٫۵ دقیقه)، MP2RAGE کمّی، T2، FLAIR، SWI/QSM، DWI و نقشه‌های میدان
  • فیزیولوژیِ محیطی: فشارِ خون، ضربان، نبض و تنفس به‌صورتِ پیوسته حینِ fMRI
  • رفتار و روان‌سنجی: شش آزمونِ شناختی و ۲۱ پرسش‌نامه، به‌علاوهٔ نمونهٔ خون و سنجه‌های تن‌سنجی

دسترسی. باز و بدونِ محدودیت، با مجوزِ PDDL، از طریقِ سطلِ S3ِ پروژهٔ INDI روی AWS یا صفحه‌های دانلودِ NITRC.

به چه دردی می‌خورد. بسامدِ نمونه‌برداریِ بالا و مدتِ نسبتاً طولانیِ ثبت، LEMON را برای تحلیل‌های نوسانی و طیفی بسیار مناسب می‌کند: سنجشِ بسامدِ اوجِ آلفا و تغییرِ آن با سن، مقایسهٔ چشم‌باز و چشم‌بسته به‌عنوانِ یک محکِ ساده و مطمئن برای صحتِ خطِ لولهٔ پردازش، تحلیلِ شیبِ مؤلفهٔ غیرتناوبیِ طیف، و اتصالِ کارکردی میانِ کانال‌ها. وجودِ هم‌زمانِ EEG و MRIِ ساختاری، آن را برای پروژه‌های بازسازیِ منبع هم گزینهٔ خوبی می‌کند.

پیوند. صفحهٔ MPI-LEMON · ارجاع: Babayan A و همکاران (۲۰۱۹)، Scientific Data 6, 180308.


داده‌های تصویربرداریِ بالینیِ طولی

ADNI (Alzheimer's Disease Neuroimaging Initiative)

چیست. یک مطالعهٔ طولیِ چندمرکزی در آمریکای شمالی که از سالِ ۲۰۰۴ افراد را در طولِ مسیرِ سالمندیِ طبیعی، اختلالِ شناختیِ خفیف (نخست EMCI و سپس LMCI) و در نهایت آلزایمر دنبال می‌کند. این مطالعه در چند فاز اجرا شده است (ADNI-1، ADNI-GO، ADNI-2 و فازهای بعدی)، و در هر فاز آزمودنیِ تازه هم وارد شده است.

چه داده‌ای دارد. تصویربرداریِ ساختاری و کارکردی (MRI و انواعِ PET)، نشانگرهای زیستیِ مایعِ مغزی–نخاعی، دادهٔ ژنومی، و مجموعهٔ گسترده‌ای از سنجه‌های بالینی و شناختی که در بازدیدهای پیاپی تکرار شده‌اند. ارزشِ اصلیِ ADNI در همین بُعدِ طولی است: همان فرد در طولِ سال‌ها.

دسترسی. این تنها موردِ فهرستِ ما است که باز نیست. باید در آرشیوِ LONI IDA درخواستِ دسترسی ثبت کنید، وابستگیِ دانشگاهی و طرحِ پژوهشیِ خود را شرح دهید، و توافق‌نامهٔ استفاده از داده را بپذیرید. کمیتهٔ اشتراکِ داده و انتشاراتِ ADNI معمولاً ظرفِ حدودِ دو هفته درخواست‌ها را بررسی می‌کند. شرایطِ توافق‌نامه سخت‌گیرانه است: استفادهٔ تجاری و بازتوزیعِ داده ممنوع است و حساب باید سالانه تمدید شود.

به چه دردی می‌خورد. برای پرسش‌هایی که به تغییر در طولِ زمان نیاز دارند: مدل‌سازیِ سیرِ آتروفی، پیش‌بینیِ گذار از MCI به آلزایمر، و پیوندِ نشانگرهای زیستی با تغییرِ ساختارِ شبکهٔ مغزی. اگر می‌خواهید کارِ مدل‌سازیِ مغزِ کامل انجام دهید و به کانکتومِ فردی نیاز دارید، ADNI یکی از گزینه‌های اصلی است. توجه کنید که سربارِ کارِ اداری و زمانِ پیش‌پردازشِ تصویربرداری در این پروژه‌ها قابلِ‌توجه است؛ آن را در برنامه‌ریزیِ خود لحاظ کنید.

پیوند. صفحهٔ دسترسی به دادهٔ ADNI


درگاه‌ها: جایی که دادهٔ بعدی را پیدا می‌کنید

فهرستِ بالا شش نمونهٔ منتخب است، نه یک سیاههٔ کامل. وقتی پرسشِ پژوهشیِ مشخصی دارید، معمولاً بهتر است به‌جای جست‌وجوی مستقیم، سراغِ درگاه‌هایی بروید که مجموعه‌های بسیاری را یک‌جا میزبانی می‌کنند:

درگاه چه چیزی میزبانی می‌کند
PhysioNet سیگنال‌های زیست‌پزشکی: EEG، ECG، داده‌های ICU و بالینی؛ منبعِ CHB-MIT
OpenNeuro تصویربرداریِ مغز در قالبِ استانداردِ BIDS: MRI، MEG، EEG، iEEG
DANDI الکتروفیزیولوژی و تصویربرداریِ سلولی در قالبِ NWB
CRCNS دادگان‌های کلاسیکِ علوم اعصابِ محاسباتی، بسیاری با مقالهٔ تحلیلیِ همراه
NITRC ابزارها و دادگان‌های تصویربرداریِ عصبی؛ میزبانِ LEMON
Registry of Open Data on AWS نسخهٔ ابریِ مجموعه‌های بزرگ، از جمله IBL و Allen

دو استانداردِ قالبِ داده هم ارزشِ شناختن دارند، چون هرچه جلوتر بروید بیشتر با آن‌ها روبه‌رو می‌شوید: BIDS برای سازمان‌دهیِ پوشه‌ها و فرادادهٔ مطالعاتِ تصویربرداری، و NWB برای فایل‌های الکتروفیزیولوژی. اگر دادهٔ خودتان را روزی منتشر کنید، پیروی از این استانداردها بزرگ‌ترین لطفی است که به کاربرانِ بعدی (که یکی از آن‌ها احتمالاً خودِ شما در دو سالِ آینده است) می‌کنید.

اخلاق، مجوز و بازتولیدپذیری

سه نکته که در کارِ با دادهٔ منتشرشده باید همیشه در نظر داشت.

مجوز را بخوانید و رعایت کنید. مجوزها یکسان نیستند. PDDL (مانندِ LEMON) عملاً داده را به مالکیتِ عمومی می‌سپارد؛ ODC-BY (مانندِ CHB-MIT) ارجاع را الزامی می‌کند؛ و توافق‌نامه‌های استفاده از داده (مانندِ ADNI) بازتوزیع و کاربردِ تجاری را ممنوع می‌کنند. اگر مطمئن نیستید، پیش از انتشارِ نتیجه بررسی کنید.

دادهٔ انسانی را بازشناسایی نکنید. حتی وقتی داده ناشناس‌سازی شده است، تلاش برای پیوندزدنِ آن به هویتِ افراد نقضِ آشکارِ شرایطِ استفاده و اخلاقِ پژوهش است. همچنین توجه کنید که تصویرِ ساختاریِ مغز به‌خودیِ‌خود می‌تواند شناسایی‌کننده باشد؛ به همین دلیل مجموعه‌هایی مانندِ LEMON نقابِ صورت‌زدایی (defacemask) دارند.

نسخهٔ داده را ثبت کنید. پایگاه‌ها به‌روزرسانی می‌شوند: اسپایک‌سورتینگِ IBL چند بار بازنگری شده و برچسب‌های بالینی هم گاهی اصلاح می‌شوند. اگر در گزارشِ خود ننویسید که از کدام نسخه و کدام تاریخِ دانلود استفاده کرده‌اید، نتیجهٔ شما بازتولیدپذیر نیست. این همان اصلی است که در پیوستِ طراحی گردش‌کار و آزمایش محاسباتی دربارهٔ فراداده گفتیم؛ فقط اینجا فراداده به داده‌ای اشاره می‌کند که خودتان تولیدش نکرده‌اید.

جمع‌بندی در یک جدول

پایگاه مقیاس گونه دسترسی مناسب برای
IBL اسپایک + LFP موش باز، ONE-api کدگذاریِ جمعیتی، تصمیم‌گیری، جفت‌شدگیِ اسپایک–فاز
Allen Brain Observatory اسپایک + کلسیم موش باز، AllenSDK کدگذاریِ حسی، انواعِ سلولی، برازشِ مدلِ نورونی
CHB-MIT EEGِ سطحی، ۲۵۶ هرتز انسان باز، PhysioNet آشکارسازی و پیش‌بینیِ تشنج
Bonn EEGِ سطحی و درون‌جمجمه‌ای، ۱۷۳٫۶ هرتز انسان باز، UPF تحلیلِ غیرخطیِ سری‌های زمانی، تمرینِ روش
LEMON EEGِ ۲۵۰۰ هرتزی + MRI انسان باز، PDDL نوساناتِ حالتِ استراحت، سالمندی، بازسازیِ منبع
ADNI MRI، PET، CSF، ژنوم انسان با درخواست و توافق‌نامه مطالعاتِ طولی، پیش‌بینیِ سیرِ بیماری

تمرین‌ها

تمرینِ ۱. فرض کنید می‌خواهید بررسی کنید که آیا توانِ باندِ گاما (۳۰ تا ۸۰ هرتز) پیش از شروعِ تشنج تغییر می‌کند. از میانِ CHB-MIT و Bonn کدام‌یک برای این پرسش مناسب است و چرا؟

پاسخ

از نظرِ بسامدِ نمونه‌برداری، هر دو از پسِ باندِ گاما برمی‌آیند: CHB-MIT با ۲۵۶ هرتز نایکوئیستِ ۱۲۸ هرتز دارد و Bonn با ۱۷۳٫۶۱ هرتز نایکوئیستِ حدودِ ۸۷ هرتز؛ هر دو بالای ۸۰ هرتز هستند، هرچند Bonn دقیقاً روی لبه است و به‌علاوه با فیلترِ میان‌گذرِ ۰٫۵۳ تا ۴۰ هرتز ثبت شده، پس عملاً بالای ۴۰ هرتز محتوایی ندارد.

اما مسئلهٔ تعیین‌کننده بسامد نیست، بلکه ساختارِ زمانیِ داده است. پرسشِ شما دربارهٔ تغییر در آستانهٔ تشنج است، یعنی به ثبتِ پیوسته‌ای نیاز دارید که دقایق یا ساعت‌های پیش از تشنج را در بر بگیرد و لحظهٔ شروعِ تشنج در آن برچسب خورده باشد. Bonn قطعه‌های ۲۳٫۶ ثانیه‌ایِ جدا از هم و تصادفی‌شده است؛ اصلاً «پیش از تشنج» در آن تعریف نمی‌شود. CHB-MIT دقیقاً برای همین ساخته شده است: ثبتِ چندروزه با حاشیه‌نویسیِ زمانِ آغاز و پایانِ هر تشنج.

تمرینِ ۲. می‌خواهید بررسی کنید که آیا نورون‌های یک ناحیه پیش از حرکتِ حیوان فعالیتشان تغییر می‌کند. کدام‌یک از پایگاه‌های این فصل داده‌ای دارد که این پرسش را ممکن کند، و دقیقاً به کدام دو لایهٔ داده نیاز دارید؟

پاسخ

IBL. به دو لایه نیاز دارید که باید بر یک محورِ زمانیِ مشترک هم‌تراز شده باشند: نخست زمانِ اسپایک‌ها به‌همراه نسبت‌دادنِ هر واحد به ناحیهٔ آناتومیک، و دوم دادهٔ رفتاری، به‌ویژه موقعیتِ لحظه‌ایِ چرخ که آغازِ حرکت را مشخص می‌کند (یا زمانِ واکنشِ ثبت‌شده در دادهٔ آزمایش‌ها).

دادهٔ Allen Brain Observatory در شاخهٔ Visual Coding این پرسش را به‌شکلِ کامل پاسخ نمی‌دهد، چون آنجا حیوان تکلیفِ تصمیم‌گیری ندارد و فقط محرکِ بینایی می‌بیند؛ هرچند سرعتِ دویدن روی چرخ ثبت می‌شود و می‌توان نسخهٔ محدودتری از پرسش را طرح کرد. شاخهٔ Visual Behavior برای پرسش‌های رفتاری مناسب‌تر است.

تمرینِ ۳. دو گروهِ پژوهشی روی CHB-MIT کار می‌کنند. گروهِ اول دقتِ ۹۹٫۲ درصد و گروهِ دوم دقتِ ۷۶ درصد گزارش می‌کند. چرا ممکن است عددِ کوچک‌ترِ گروهِ دوم ارزشِ علمیِ بیشتری داشته باشد؟

پاسخ

چون عدد بدونِ طرحِ ارزیابی بی‌معناست. اگر گروهِ اول پنجره‌ها را تصادفی میانِ آموزش و آزمون تقسیم کرده باشد، پنجره‌های همسایه از یک تشنجِ واحد در هر دو مجموعه حاضرند و مدل به‌جای یادگیریِ الگویِ عمومیِ تشنج، امضایِ همان تشنجِ خاص را حفظ می‌کند. این نشتِ داده است و عددِ حاصل روی بیمارِ تازه تکرار نمی‌شود.

اگر گروهِ دوم ارزیابیِ «یک بیمار بیرون‌گذاشته» (leave-one-patient-out) انجام داده باشد، ۷۶ درصدِ او تخمینی صادقانه از عملکرد روی بیمارِ ندیده است. مقایسهٔ دو عدد بدونِ دانستنِ این موضوع، مقایسهٔ دو چیزِ متفاوت است. همین نکته دلیلِ آن است که در فصلِ راستی‌آزمایی و اعتبارسنجی بر تفکیکِ روشنِ داده تأکید کردیم.

منابع

  • IBL و همکاران (۲۰۲۵)، A brain-wide map of neural activity during complex behaviour, Nature. https://www.nature.com/articles/s41586-025-09235-0
  • Guttag J (۲۰۱۰)، CHB-MIT Scalp EEG Database, PhysioNet. https://doi.org/10.13026/C2K01R
  • Andrzejak RG، Lehnertz K، Rieke C، Mormann F، David P، Elger CE (۲۰۰۱)، Indications of nonlinear deterministic and finite dimensional structures in time series of brain electrical activity, Phys. Rev. E 64, 061907.
  • Babayan A و همکاران (۲۰۱۹)، A mind-brain-body dataset of MRI, EEG, cognition, emotion, and peripheral physiology in young and old adults, Scientific Data 6, 180308.
  • Allen Institute for Brain Science، Allen Brain Map. https://brain-map.org/
  • Alzheimer's Disease Neuroimaging Initiative. https://adni.loni.usc.edu/