هوش مصنوعی · یادگیری عمیق

EBM چیست؟ Energy-Based Models، انرژی و JEPA

مفاهیم بنیادین انرژی در معماری هوش مصنوعی
Energy-Based Model EBM Energy-Based Learning Latent Variable LV-EBM JEPA EB-JEPA Yann LeCun World Model یادگیری خودنظارتی

۱. مقدمه: انرژی، اما نه آنچه فکر می‌کنید

وقتی برای اولین بار با اصطلاح Energy در ادبیاتِ یادگیریِ ماشین مواجه می‌شویم، ناخودآگاه به‌سوی فیزیک می‌رویم؛ به قانونِ پایستگیِ انرژی، به ژول و کالری. اما در Energy-Based Models (EBMs) چنین برداشتی نه تنها نادرست، بلکه گمراه‌کننده است.

نکته کلیدی

انرژی در اینجا یک «تابعِ سازگاری» (Compatibility Function) است؛ نه یک کمیتِ فیزیکی.

یان لکان، برنده‌ی جایزه‌ی تورینگ و یکی از پیشگامانِ یادگیریِ عمیق، در مقاله‌ی تأثیرگذار خود با عنوان "A Path Towards Autonomous Machine Intelligence" (۲۰۲۲)، انرژی را به‌عنوان شیءِ بنیادینِ مدل معرفی می‌کند و در بحث گسترده‌تر خود دربارهٔ معماری هوش مصنوعی خودمختار به نقش این مفاهیم در یک معماری بزرگ‌تر می‌پردازد:

"The energy function is viewed as the fundamental object and is not assumed to implicitly represent the unnormalized logarithm of a probability distribution."

به‌بیانِ ساده‌تر: انرژی، معیاری است که به سیستم می‌گوید «این پاسخ چقدر با جهانِ واقعی سازگار است؟»

مفهوم Energy در هوش مصنوعی و Energy-Based Models
شکل ۱: مفهوم Energy به‌عنوان تابع سازگاری در مدل‌های مبتنی بر انرژی

۲. EBM چیست و Energy-Based Model دقیقاً چه چیزی را مدل می‌کند؟

اگر عبارت EBM را در حوزه‌ی هوش مصنوعی جست‌وجو کنیم، منظور اصلی در این مقاله Energy-Based Model یا Energy-Based Models است؛ خانواده‌ای از مدل‌ها که به‌جای آن‌که الزاماً برای هر پاسخ یک احتمالِ نرمال‌شده تولید کنند، یک Energy Function تعریف می‌کنند و از مقدار آن برای سنجش سازگاری استفاده می‌کنند.

نقشه‌ی مفهومی EBM

EBM → Energy Function → Energy Landscape → Energy Minimization → Inference → Latent Variable → Joint Embedding → JEPA

این زنجیره نشان می‌دهد که EBM فقط یک روش برای محاسبه‌ی یک عدد نیست؛ بلکه یک شیوه برای تعریف «سازگاری»، انجام Inference و در برخی معماری‌ها پیش‌بینی در Latent Space و برنامه‌ریزی است.

اصطلاح نقش در EBM عبارت‌های مرتبط
Energy-Based Model چارچوب کلی مدل‌سازی با تابع انرژی EBM، Energy-Based Models، Deep EBM
Energy Function امتیاز سازگاری یک پیکربندی تابع انرژی، Energy Function
Energy Landscape شکل فضایی مقادیر انرژی چشم‌انداز انرژی، Energy Landscape
Energy Minimization پیدا کردن پیکربندی‌های کم‌انرژی کمینه‌سازی انرژی، Energy-Based Inference
Latent Variable EBM مدل‌کردن عوامل پنهان یا توضیح‌دهنده LV-EBM، Latent Variable Energy-Based Model
JEPA پیش‌بینی در فضای بازنمایی Joint Embedding Predictive Architecture، JEPA AI

یک نکته‌ی مهم برای درک EBM در هوش مصنوعی این است که «انرژی» با انرژی فیزیکی یکسان نیست. همچنین EBM را نباید به‌طور خودکار معادل یک مدل احتمالاتی دانست. در برخی فرمول‌بندی‌ها می‌توان از انرژی برای ساخت یک توزیع احتمال استفاده کرد، اما در نگاه سازگاری‌محور لکان، خودِ Energy Function شیءِ بنیادی است.

۳. تعریفِ ریاضیِ Energy-Based Model

یک مدلِ مبتنی بر انرژی، تابعی است که به‌صورتِ زیر تعریف می‌شود:

Fw : 𝒳 × 𝒴 → ℝ

که در آن:

  • 𝒳: فضای ورودی‌ها
  • 𝒴: فضای خروجی‌ها یا حالت‌های ممکن
  • w ∈ ℝd: بردار پارامترهای مدل

تابع انرژی، به‌ازای هر جفت (x, y) یک مقدار اسکالر تولید می‌کند:

E(x, y) = Fw(x, y)

هدف آموزش این است که پاسخ‌های درست انرژی کمتری از پاسخ‌های نادرست داشته باشند:

Fw(x, ytrue) ≪ Fw(x, yfalse)

۴. Latent Variable، Free Energy و رابطه‌ی EBM با JEPA

تا اینجا فرض کردیم (x, y) مستقیماً وضعیت موردنظر را توضیح می‌دهد. اما در بسیاری از مسائل، بخشی از علت یا ساختار تولیدکننده داده مشاهده نمی‌شود. اینجا مفهوم Latent Variable یا متغیر نهان وارد می‌شود.

در یک Latent Variable Energy-Based Model یا LV-EBM ، انرژی به شکل زیر گسترش پیدا می‌کند:

E(x, y, z)

یکی از صورت‌بندی‌های مفهوم Free Energy به شکل زیر نوشته می‌شود:

F(x, y) = −(1/β) log ∫ exp(−βE(x, y, z)) dz

در این نگاه، Latent Space فقط فضایی برای فشرده‌سازی اطلاعات نیست؛ می‌تواند فضایی باشد که در آن بخش مهمی از ساختار قابل‌پیش‌بینی جهان نمایش داده شود.

EBM و JEPA چه رابطه‌ای دارند؟

در چارچوب Dawid و LeCun، مزایای Energy-Based Models و Latent Variable Models در ساخت بلوک‌های اصلی معماری Hierarchical JEPA (H-JEPA) ترکیب می‌شوند.

در JEPA هدف پیش‌بینی یک بازنمایی از بخش یا وضعیت آینده است؛ نه بازسازی تمام جزئیات خام ورودی.

zfuture ≈ Predictor(zcontext, action)

یک نکته‌ی مهم درباره‌ی EB-JEPA

در سال ۲۰۲۶ پروژه و مقاله‌ی EB-JEPA با عنوان Energy-Based Joint-Embedding Predictive Architectures منتشر شد و نمونه‌هایی برای یادگیری بازنمایی، پیش‌بینی و برنامه‌ریزی با JEPA ارائه می‌کند.

۵. Energy Landscape؛ چشم‌اندازِ انرژی

مجموعه‌ی مقادیر انرژی به‌ازای تمام y های ممکن، یک چشم‌انداز انرژی تشکیل می‌دهد:

ℰ(x) = { Fw(x, y) | y ∈ 𝒴 }
نمودار Energy Landscape و چشم‌انداز انرژی در مدل‌های مبتنی بر انرژی
شکل ۲: نمایش شماتیک Energy Landscape؛ دره‌ها (کم‌انرژی) و قله‌ها (پرانرژی)
  • دره‌ها → پاسخ‌های سازگار با داده و قیود
  • قله‌ها → پاسخ‌های ناسازگار

۶. Energy در فضاهایِ گسسته و پیوسته

نکته مهم

پیوسته‌بودن Energy، شرط تعریف EBM نیست.

EBM می‌تواند روی فضاهای گسسته نیز تعریف شود. برای مثال در Classification:

E(x, k) = Fw(x, k)   where   k ∈ {1, 2, ..., K}

اگر Energy یک تابع مشتق‌پذیر باشد، می‌توان از گرادیان برای یافتن نقاط کم‌انرژی استفاده کرد:

∇y E(x, y)

۷. گرادیان، Energy Minimization و Inference-as-Optimization

اگر تابع انرژی روی فضای پیوسته تعریف شده باشد و مشتق‌پذیر باشد:

∇y E(x, y) = [ ∂E/∂y1, ∂E/∂y2, ..., ∂E/∂yd ]T

برای حرکت به‌سمت نقاط کم‌انرژی:

yt+1 = yt − η ∇y E(x, yt)

در نتیجه:

y* = arg min y ∈ 𝒴 E(x, y)

برای بررسی بیشتر ارتباط این ایده با یادگیری گرادیانی و استدلال، می‌توان به مقالهٔ Reasoning و Gradient-Based Learning نیز مراجعه کرد.

"Reasoning can be formulated as energy minimization under constraints."

۸. Energy Collapse و Representation Collapse؛ دو مفهوم مرتبط اما متفاوت

اگر مدل نتواند بین پیکربندی‌های سازگار و ناسازگار تفاوت کافی ایجاد کند، چشم‌انداز انرژی می‌تواند بیش از حد تخت شود:

E(x, y) ≈ Constant

این مسئله با Representation Collapse مرتبط است، اما این دو اصطلاح دقیقاً یک پدیده نیستند.

معماری مستعد Collapse؟ توضیح
معماری پیش‌بینی قطعی در صورت‌بندی مورد بحث لکان: خیر در صورت‌بندی پیش‌بینی قطعی مورد بحث، تطبیق مستقیم پیش‌بینی و هدف مانع از collapse موردنظر می‌شود.
معماری مولد با متغیر نهان بله اگر ظرفیت اطلاعاتی متغیر نهان زیاد باشد، ممکن است راه‌حل‌های دژنره شکل بگیرند.
خودرمزگذار بله بسته به تابع آموزش و قیود، بازنمایی می‌تواند دچار راه‌حل‌های دژنره شود.
معماری جاسازی مشترک بله اگر رمزگذارها ورودی را نادیده بگیرند یا بازنمایی‌ها collapse کنند.

۹. دو رویکرد اصلی برای آموزش EBM

آموزش Energy-Based Models یکی از بخش‌های چالش‌برانگیز این حوزه است. روش‌هایی مانند Maximum Likelihood، MCMC، Score Matching، Noise Contrastive Estimation (NCE) و روش‌های مبتنی بر Langevin Dynamics در ادبیات EBM مطرح شده‌اند.

۹.۱. روش‌های تقابلی (Contrastive Methods)

ایده اصلی: انرژی نمونه‌های مثبت را پایین ببر و انرژی نمونه‌های تقابلی را بالا ببر.

ℒ(w, x, y, ŷ) = [ E(x, y) − E(x, ŷ) + m(y, ŷ) ] +

یک نمونه از Lossهای تقابلی، InfoNCE است.

۹.۲. روش‌های منظم‌شده (Regularized Methods)

در روش‌های Regularized، علاوه بر پایین‌آوردن انرژی نمونه‌های مثبت، شکل فضای کم‌انرژی نیز کنترل می‌شود.

ℒ(w, x, y) = E(x, y) + λ · ℛ(w)

مزیت روش‌های منظم‌شده

این روش‌ها به‌جای تکیه صرف بر مجموعه‌ای بزرگ از نمونه‌های منفی، مستقیماً روی شکل‌دهی به فضای کم‌انرژی تمرکز می‌کنند.

"Regularized methods are much more promising in the long run than contrastive methods because they can eschew the curse of dimensionality that plagues contrastive methods."

۱۰. Energy به‌عنوان معیار سازگاری در World Model

در معماری بزرگ‌تر لکان برای Autonomous Machine Intelligence ، Energy می‌تواند در ارزیابی وضعیت‌های آینده و برنامه‌ریزی مورد استفاده قرار گیرد.

  1. جهان را مشاهده کند.
  2. یک بازنمایی درونی بسازد.
  3. وضعیت آینده را پیش‌بینی کند.
  4. پیامد اقدامات مختلف را بررسی کند.
  5. اقدام مناسب را تحت قیود و اهداف جست‌وجو کند.

برای مطالعه بیشتر درباره برداشت لکان از World Model: مقالهٔ World Model و دیدگاه لکان

E(st, at, st+1) ∝ −Compatibility(st, at, st+1)

در یک صورت‌بندی ساده از Planning:

at* = arg min at Σt' E( st', at', st'+1 )

یعنی: دنباله‌ای از اقدامات را پیدا کن که معیار انرژی/هزینه مسیر را کمینه کند.

۱۱. تفاوت Energy و Reward و Cost

ویژگی Energy Reward
منبع تابعی که مدل برای سنجش سازگاری/هزینه تعریف یا می‌آموزد سیگنال بازخوردی برای ارزیابی رفتار، معمولاً در RL
نقش Inference، Prediction و Planning یادگیری Policy و ارزیابی پیامد عمل
دامنه می‌تواند گسسته یا پیوسته باشد می‌تواند گسسته یا پیوسته باشد
جهت بهینه‌سازی معمولاً کمینه می‌شود معمولاً بیشینه می‌شود

در بعضی طراحی‌ها می‌توان رابطه‌ای مانند:

Reward ≈ −Energy

تعریف کرد، اما این یک هم‌ارزی عمومی میان دو مفهوم نیست.

"Contrary to the title of a recent position paper by Silver et al. (2021), the reward plays a relatively minor role in this scenario."

۱۲. جمع‌بندی: EBM، Latent Space و JEPA در یک نقشه‌ی مفهومی

در این مقاله دیدیم که EBM یا Energy-Based Model یک زاویه متفاوت برای ساخت هوش مصنوعی ارائه می‌کند: به‌جای آنکه همیشه خروجی را مستقیماً تولید کنیم، می‌توانیم یک Energy Function داشته باشیم که سازگاری حالت‌ها را مشخص کند و سپس با Energy Minimization به پاسخ برسیم.

وقتی Latent Variable و Latent Space را اضافه می‌کنیم، انرژی می‌تواند توضیح‌هایی را که مستقیماً مشاهده نمی‌شوند مدل کند. این نگاه با Joint Embedding و JEPA پیوند می‌خورد.

نقشه‌ی نهایی

Energy-Based Model → Energy Function → Energy Landscape → Inference as Optimization → Latent Variable / Latent Space → Joint Embedding → JEPA → World Model → Planning

جهان اول: استدلال جهان دوم: یادگیری
قوانین «اگر... آنگاه...» بهینه‌سازی گرادیانی
منطق گسسته شبکه‌های عصبی پیوسته
قیود (Constraints) توابع هزینه (Loss)

پیام کلیدی

انرژی، قیود را به توابع هزینه تبدیل می‌کند و استدلال را به یک مسئله‌ی بهینه‌سازی.

۱۳. پرسش‌های متداول درباره EBM، Latent Variable و JEPA

EBM چیست؟

EBM مخفف Energy-Based Model است؛ مدلی که برای پیکربندی‌های مختلف یک مقدار انرژی تعریف می‌کند تا میزان سازگاری آن‌ها مشخص شود.

آیا EBM همان مدل احتمالاتی است؟

نه الزاماً. برخی EBMها را می‌توان برای تعریف توزیع‌های احتمال به‌کار برد، اما در دیدگاه سازگاری‌محور، Energy Function می‌تواند بدون آنکه مستقیماً یک probability distribution نرمال‌شده باشد، شیء اصلی مدل باقی بماند.

Latent Variable در EBM چه کاری انجام می‌دهد؟

Latent Variable یا متغیر نهان، عواملی را نمایش می‌دهد که در داده مستقیماً مشاهده نمی‌شوند. در Latent Variable EBM ، این متغیر می‌تواند برای توضیح ساختار پنهان بین ورودی و خروجی استفاده شود.

JEPA چه ارتباطی با EBM دارد؟

در چارچوب Dawid و LeCun، انرژی و متغیرهای نهان در شکل‌دهی به معماری‌های Hierarchical JEPA نقش دارند. JEPA نیز پیش‌بینی را در فضای بازنمایی انجام می‌دهد.

EB-JEPA چیست؟

EB-JEPA نام یک مسیر پژوهشی و کتابخانه متن‌باز در سال ۲۰۲۶ است که نمونه‌هایی برای یادگیری بازنمایی، پیش‌بینی و برنامه‌ریزی با معماری‌های Joint-Embedding Predictive ارائه می‌کند.

تفاوت Representation Collapse و Energy Collapse چیست؟

Representation Collapse به وضعیتی اشاره دارد که بازنمایی‌های چند ورودی مختلف بیش از حد شبیه یا تقریباً یکسان شوند. Energy Collapse به تخت‌شدن یا از دست رفتن تمایز معنادار در چشم‌انداز انرژی اشاره می‌کند. این دو مسئله مرتبط‌اند، اما از نظر فنی یکی نیستند.

مراجع و مطالعه بیشتر

  1. LeCun, Y. (2022). "A Path Towards Autonomous Machine Intelligence" . OpenReview. https://openreview.net/pdf?id=BZ5a1r-kVsf
  2. Dawid, A., & LeCun, Y. (2023). "Introduction to Latent Variable Energy-Based Models: A Path Towards Autonomous Machine Intelligence" . arXiv. https://arxiv.org/abs/2306.02572
  3. LeCun, Y., et al. (2006). "A Tutorial on Energy-Based Learning" . In Predicting Structured Data.
  4. Grill, J. B., et al. (2020). "Bootstrap Your Own Latent" . NeurIPS.
  5. Chen, T., et al. (2020). "A Simple Framework for Contrastive Learning of Visual Representations" . ICML.
  6. Zbontar, J., et al. (2021). "Barlow Twins: Self-Supervised Learning via Redundancy Reduction" . ICML.
  7. Silver, D., et al. (2021). "Reward is Enough" . Artificial Intelligence, 299, 103535.
  8. Terver, B., et al. (2026). "A Lightweight Library for Energy-Based Joint-Embedding Predictive Architectures" . arXiv:2602.03604. https://arxiv.org/abs/2602.03604