هوش مصنوعی · فلسفه · یان لکان

فلسفه وجودی رویکرد یان لکان در هوش مصنوعی

از نقد پارادایم یادگیری مبتنی بر گرادیان تا ضرورت یادگیری مدل جهان
یان لکان هوش مصنوعی مدل جهان یادگیری تقویتی فلسفه هوش

مقدمه

در سال‌های اخیر، پیشرفت‌های چشمگیری در حوزه هوش مصنوعی، به‌ویژه در زمینه یادگیری عمیق و مدل‌های زبانی بزرگ، حاصل شده است. موفقیت مدل‌هایی مانند GPT، سامانه‌های بینایی ماشین و بسیاری از الگوریتم‌های یادگیری تقویتی نشان می‌دهد که روش‌های مبتنی بر شبکه‌های عصبی توانسته‌اند دامنه وسیعی از مسائل را با دقت قابل توجهی حل کنند. با وجود این دستاوردها، همچنان این پرسش اساسی مطرح است که آیا چنین سیستم‌هایی واقعاً دارای «هوش» هستند یا صرفاً می‌توانند الگوهای آماری بسیار پیچیده را یاد بگیرند و بازتولید کنند.

یان لکان (Yann LeCun) این پرسش را در چارچوب نقد خود بر وضعیت کنونی هوش مصنوعی مطرح می‌کند. از دیدگاه او، مسئله فقط قدرت پردازش، اندازه مدل یا حجم داده آموزشی نیست؛ بلکه به پارادایم یادگیری نیز مربوط می‌شود. به بیان دیگر، لکان بر این باور است که مسیر یادگیری ماشین‌های امروزی با شیوه‌ای که انسان و حیوانات هوشمند از جهان می‌آموزند تفاوت‌های مهمی دارد. بنابراین، مسئله صرفاً یک مسئله مهندسی نیست و به پرسش‌هایی درباره شناخت، یادگیری و ماهیت هوش نیز مربوط می‌شود.

پارادایم غالب در هوش مصنوعی امروز

بخش بزرگی از موفقیت‌های کنونی هوش مصنوعی بر روش‌های بهینه‌سازی مبتنی بر گرادیان تکیه دارد؛ یعنی پارامترهای یک مدل بر اساس یک تابع هدف یا هزینه و با استفاده از گرادیان به‌صورت تدریجی به‌روزرسانی می‌شوند.

البته اهداف یادگیری در مدل‌های زبانی، سامانه‌های بینایی و یادگیری تقویتی یکسان نیستند، اما در بسیاری از این سامانه‌ها می‌توان یک الگوی عمومی مشابه دید: مدل بر اساس وضعیت فعلی خود خروجی یا رفتار تولید می‌کند، عملکرد آن با یک هدف یا سیگنال بازخوردی ارزیابی می‌شود و سپس پارامترها برای بهبود عملکرد به‌روزرسانی می‌شوند.

📐 از منظر ریاضی، ایده اصلی را می‌توان این‌گونه خلاصه کرد

«پارامترهای مدل را به گونه‌ای تغییر بده که مقدار تابع هدف یا هزینه کاهش یابد.»

این فرایند می‌تواند بارها و بارها تکرار شود تا مدل به سطح عملکرد موردنظر برسد.

یادگیری تقویتی؛ تجربه به‌جای پاسخ صحیح

در یادگیری تقویتی (Reinforcement Learning)، پاسخ صحیح از پیش برای هر وضعیت مشخص نشده است و عامل از طریق تعامل با محیط و دریافت بازخورد رفتاری خود را اصلاح می‌کند. عامل عملی را انتخاب می‌کند، پیامد آن را مشاهده می‌کند، پاداش یا جریمه دریافت می‌کند و سپس سیاست خود را بر اساس این بازخورد به‌روزرسانی می‌کند.

🔄 چرخه یادگیری تقویتی

Action → Environment → Reward → Update

در بسیاری از تنظیمات یادگیری تقویتی، عامل برای کشف پیامد اقدامات خود به تعامل با محیط نیاز دارد. این وابستگی، به‌ویژه در روش‌های model-free، می‌تواند موجب نیاز به تعداد زیادی آزمون و تعامل شود. خود لکان نیز model-free RL را از نظر Sample Efficiency، در مقایسه با یادگیری انسان و حیوانات، بسیار ناکارآمد توصیف می‌کند.

از دیدگاه لکان، مسئله در اینجا آن است که اگر یادگیری عمدتاً بر آزمون‌های مستقیم و بازخوردهای محدود متکی باشد، عامل برای کشف بسیاری از روابط موجود در جهان مجبور به تجربه دوباره و دوباره پیامدهای واقعی خواهد شد. به باور او، بخش بزرگی از این یادگیری باید بتواند بدون انجام همه این آزمون‌های پرهزینه، از طریق مشاهده و مدل‌سازی جهان صورت گیرد.

نمودار مقایسه چرخه یادگیری تقویتی با رویکرد یادگیری مدل جهان در دیدگاه یان لکان
شکل ۱: مقایسه چرخه یادگیری تقویتی سنتی با رویکرد یادگیری مدل جهان

نقد نخست: وابستگی یادگیری به تعامل مستقیم با جهان

نخستین انتقاد لکان متوجه وابستگی شدید بسیاری از سامانه‌های یادگیری، به‌ویژه در تنظیمات model-free، به تعامل با محیط است. در چنین سامانه‌هایی، عامل بخشی از دانش خود را از طریق انجام عمل و مشاهده پیامد آن به دست می‌آورد.

نقل به مضمون از دیدگاه لکان: تعامل با جهان واقعی پرهزینه و در برخی کاربردها خطرناک است؛ بنابراین یک عامل هوشمند باید تا حد امکان بتواند از طریق مشاهده و یادگیری یک مدل درونی از جهان، نیاز به آزمون‌های مستقیم را کاهش دهد.
— بر اساس بحث لکان در A Path Towards Autonomous Machine Intelligence

لکان این موضوع را از منظر مقیاس‌پذیری یادگیری مهم می‌داند. در بسیاری از کاربردهای واقعی، تجربه مستقیم نه‌تنها زمان‌بر، بلکه پرهزینه یا بالقوه خطرناک است. به همین دلیل، یادگیری از مشاهده و پیش‌بینی پیامدها می‌تواند نقش مهمی در کاهش تعداد تعاملات ضروری با جهان داشته باشد.

نقد دوم: فقدان مدل جهان (World Model)

یکی از بنیادی‌ترین مفاهیم در اندیشه لکان، «مدل جهان» (World Model) است. او در طرح خود بر این ایده تأکید می‌کند که عامل هوشمند باید نوعی نمایش درونی و قابل استفاده از نحوه تغییر جهان در اختیار داشته باشد.

از نگاه لکان، مسئله این نیست که هر سامانه امروزی الزاماً فاقد هرگونه بازنمایی از جهان است؛ بلکه نقد او متوجه این است که بسیاری از رویکردهای رایج، مدل‌سازی صریح و قابل استفاده از پویایی جهان را در مرکز فرایند یادگیری قرار نمی‌دهند. در نتیجه، یک سیستم ممکن است بتواند ارتباط‌های آماری پیچیده میان ورودی، وضعیت و عمل را یاد بگیرد، بدون آنکه بتواند به‌صورت مؤثر پیامدهای آینده را در یک مدل درونی شبیه‌سازی کند.

نقل به مضمون از لکان: یکی از مسیرهای دستیابی به هوش ماشین می‌تواند در توانایی انسان و حیوانات برای یادگیری مدل‌های جهان باشد؛ یعنی مدل‌های درونی که نحوه کارکرد جهان را توصیف می‌کنند.
— یان لکان، A Path Towards Autonomous Machine Intelligence

از این منظر، چیزی که ما «عقل سلیم» می‌نامیم تا حد زیادی به دانش ضمنی درباره نحوه رفتار اشیا، رویدادها و روابط علّی یا فیزیکی جهان وابسته است. چنین دانشی به عامل اجازه می‌دهد درباره آنچه محتمل، ممکن یا نامحتمل است پیش‌بینی‌های بهتری داشته باشد.

نقد سوم: ناتوانی در شبیه‌سازی ذهنی آینده

یکی دیگر از تفاوت‌های مورد تأکید لکان، توانایی پیش‌بینی پیامد اعمال پیش از اجرای آن‌هاست. انسان می‌تواند پیش از انجام یک عمل، سناریوهای مختلف را در ذهن خود تصور کند، پیامدهای احتمالی آن‌ها را بسنجد و سپس تصمیم بگیرد.

لکان معتقد است یک عامل خودمختار نیز باید بتواند از مدل جهان خود برای پیش‌بینی وضعیت‌های آینده استفاده کند. در این صورت، عامل می‌تواند به‌جای اینکه برای هر گزینه حتماً آن را در جهان واقعی آزمایش کند، تعدادی از پیامدهای احتمالی را در فضای مدل داخلی خود بررسی کند.

در معماری پیشنهادی او، مدل جهان برای پیش‌بینی وضعیت‌های احتمالی آینده و فراهم‌کردن بستری برای برنامه‌ریزی و جست‌وجوی مسیرهای مختلف استفاده می‌شود. این ایده با مفهوم «عمل در جهان قبل از عمل واقعی» تفاوت دارد: ابتدا پیامدها در مدل پیش‌بینی می‌شوند و سپس یک تصمیم برای اجرا انتخاب می‌شود.

نقد چهارم: بهره‌وری پایین در استفاده از داده

یکی از پیامدهای مستقیم وابستگی زیاد به تجربه، افزایش تعداد نمونه‌ها و تعاملات موردنیاز برای یادگیری است. لکان به‌طور مشخص بر این مسئله تأکید می‌کند که روش‌های model-free RL، در مقایسه با یادگیری انسان و حیوانات، از نظر Sample Efficiency بسیار ناکارآمد هستند.

در بسیاری از کاربردهای واقعی، چنین میزان آزمون و خطایی امکان‌پذیر نیست. برای مثال، یک ربات نمی‌تواند برای یادگیری یک مهارت هر خطای فیزیکی را میلیون‌ها بار تکرار کند و یک خودروی خودران نیز نمی‌تواند برای کشف پیامدهای خطرناک تصمیم‌های خود منتظر وقوع تعداد زیادی تصادف باشد.

📊 بهره‌وری یادگیری (Sample Efficiency)

از نگاه لکان، یکی از اهداف اصلی معماری‌های مبتنی بر مدل جهان این است که حجم زیادی از دانش از طریق مشاهده و پیش‌بینی آموخته شود تا تعداد تعاملات مستقیم موردنیاز برای یادگیری مهارت‌ها کاهش پیدا کند.

این دیدگاه، فاصله میان روش‌های رایج یادگیری تقویتی model-free و شیوه یادگیری انسان و حیوانات را به یکی از مسائل مهم پژوهشی در مسیر هوش خودمختار تبدیل می‌کند.

نقد پنجم: وابستگی بیش از حد به سیگنال پاداش

در بسیاری از الگوریتم‌های یادگیری تقویتی، پاداش نقش مهمی در هدایت فرایند یادگیری دارد. عامل بر اساس سیگنال‌های مثبت یا منفی دریافتی از محیط، سیاست خود را اصلاح می‌کند.

لکان معتقد است این نوع سیگنال، به‌تنهایی اطلاعات کافی برای یادگیری تمام ساختار پیچیده موردنیاز یک عامل هوشمند فراهم نمی‌کند. از دیدگاه او، پاداش یک سیگنال اسکالر و کم‌اطلاعات است و نمی‌تواند جایگزین یادگیری گسترده درباره ساختار جهان شود.

نقل به مضمون از لکان: پاداش سیگنالی کم‌اطلاعات است؛ بنابراین نباید انتظار داشت که یک سامانه پیچیده فقط با اتکا به پاداش، تمام دانش لازم برای رفتار هوشمند را یاد بگیرد.
— بر اساس بخش «Reward is not enough» در A Path Towards Autonomous Machine Intelligence

در طرح لکان، یادگیری مدل جهان از طریق پیش‌بینی می‌تواند بخش بسیار بزرگ‌تری از پارامترهای سامانه را آموزش دهد، در حالی که پاداش یا هزینه ذاتی بیشتر برای هدایت رفتار، تعیین اهداف و ارزیابی مسیرهای آینده به کار می‌رود.

نقد ششم: محدودیت در استدلال و برنامه‌ریزی

آخرین نقد مهم لکان به محدودبودن شکل‌های استدلال و برنامه‌ریزی در بسیاری از سامانه‌های موجود مربوط می‌شود. او استدلال می‌کند که برخی مدل‌های فعلی در عمل عمدتاً نگاشت‌هایی از مشاهده به خروجی یا عمل ایجاد می‌کنند و در آن‌ها امکان جست‌وجوی غنی بر سر تفسیرهای مختلف و مسیرهای متفاوت برای رسیدن به یک هدف محدود است.

در مقابل، عامل موردنظر لکان باید بتواند اهداف را در سطوح مختلف تعریف کند، مسیرهای جایگزین را بررسی کند، پیامدهای احتمالی هر مسیر را در مدل جهان پیش‌بینی کند و سپس توالی مناسبی از اقدامات را انتخاب کند.

در مقاله لکان، این نوع استدلال به مسئله جست‌وجو و کمینه‌سازی انرژی یا ارضای قیود برای یافتن ترکیبی مناسب از اعمال و متغیرهای نهفته مرتبط می‌شود. او همچنین اشاره می‌کند که نبود متغیرهای انتزاعی نهفته می‌تواند توانایی یک مدل برای بررسی تفسیرهای متعدد از یک ادراک و جست‌وجوی مسیر مناسب برای رسیدن به هدف را محدود کند.

جمع‌بندی

تحلیل دیدگاه یان لکان نشان می‌دهد که نقد او متوجه موفقیت‌های مهندسی یادگیری عمیق نیست، بلکه به محدودیت‌های یک پارادایم خاص از یادگیری و معماری شناختی مربوط می‌شود. از نگاه او، مسئله اصلی فقط افزایش دقت مدل‌ها نیست؛ بلکه این است که چگونه می‌توان سامانه‌هایی ساخت که مانند موجودات هوشمند بتوانند جهان را مشاهده کنند، یک مدل درونی از آن بسازند و از آن مدل برای پیش‌بینی و تصمیم‌گیری استفاده کنند.

در این چارچوب، وابستگی زیاد برخی روش‌ها به تعامل مستقیم، Sample Efficiency پایین در model-free RL، اتکای قابل توجه به سیگنال پاداش، نبود یک مدل جهان قابل استفاده، محدودیت در شبیه‌سازی آینده و دشواری استدلال و برنامه‌ریزی، همگی به یک پرسش عمیق‌تر منتهی می‌شوند: آیا می‌توان یادگیری را طوری سازمان داد که بخش عمده‌ای از دانش موردنیاز عامل، پیش از انجام همه اقدامات در جهان واقعی، از طریق مشاهده و پیش‌بینی آموخته شود؟

🎯 پیام کلیدی لکان

نسل بعدی هوش مصنوعی در چشم‌انداز لکان باید صرفاً به یادگیری نگاشت‌های آماری اکتفا نکند، بلکه بتواند ساختار جهان را بیاموزد، وضعیت‌های آینده را پیش‌بینی کند، سناریوهای مختلف را در مدل داخلی خود بررسی کند و پیش از تعامل با محیط، پیامد تصمیم‌های خود را ارزیابی کند.

در این دیدگاه، مدل جهان یک مؤلفه جانبی نیست؛ بلکه بخشی مرکزی از معماری لازم برای دستیابی به یادگیری کارآمد، برنامه‌ریزی و هوش خودمختار به شمار می‌رود.

پرسش‌های متداول

آیا یان لکان با یادگیری مبتنی بر گرادیان مخالف است؟

نه به این معنا که یادگیری مبتنی بر گرادیان را به‌طور کلی کنار بگذارد. در طرح او نیز یادگیری و جست‌وجوی مبتنی بر گرادیان در بخش‌هایی از معماری نقش دارند. نقد اصلی او متوجه کافی‌نبودن یک رویکرد صرفاً متکی بر این ابزارها برای ساخت عامل‌هایی با مدل جهان، برنامه‌ریزی و یادگیری بسیار کارآمد است.

منظور لکان از World Model چیست؟

مدل جهان در چارچوب لکان نوعی نمایش درونی و قابل پیش‌بینی از وضعیت‌ها و پویایی‌های جهان است که عامل می‌تواند از آن برای پیش‌بینی وضعیت‌های آینده، ارزیابی اقدامات و برنامه‌ریزی استفاده کند.

چرا لکان پاداش را برای یادگیری هوشمند کافی نمی‌داند؟

چون پاداش معمولاً یک سیگنال اسکالر و کم‌اطلاعات است و به‌تنهایی اطلاعات گسترده‌ای درباره ساختار جهان ارائه نمی‌کند. در دیدگاه لکان، یادگیری جهان از طریق مشاهده و پیش‌بینی باید بخش بسیار بزرگ‌تری از فرایند یادگیری را تشکیل دهد و پاداش یا هزینه بیشتر برای هدایت رفتار و ارزیابی مسیرها استفاده شود.

آیا World Model فقط برای ربات‌ها و خودروهای خودران کاربرد دارد؟

خیر. ایده مدل جهان در معماری لکان یک مفهوم عمومی برای عامل‌های خودمختار است و می‌تواند به سامانه‌هایی مربوط شود که باید محیط، پیامد اقدامات و حالت‌های آینده را پیش‌بینی کنند؛ رباتیک تنها یکی از نمونه‌های مهم این مسئله است.

منابع و مطالعه بیشتر

  1. LeCun, Y. (2022). A Path Towards Autonomous Machine Intelligence. OpenReview, Version 0.9.2. https://openreview.net/pdf?id=BZ5a1r-kVsf
  2. Yann LeCun — Official Website: https://yann.lecun.org/