পাঠ ২৬ · ৩৫-এর মধ্যে · মডিউল ৬
Home / AI Courses / Math for AI & ML / কন্টিনিউয়াস বিতরণ ও গাউসিয়ান

কন্টিনিউয়াস বিতরণ ও গাউসিয়ান

Continuous distributions & the Gaussian
১৩ মিনিট পড়া মধ্যম · Intermediate NumPy কোডসহ সম্পূর্ণ বাংলায়

এই পাঠে যা শিখবেন

  • PDF ও PMF-এর মধ্যে মৌলিক পার্থক্য এবং কেন PDF-এর মান নিজেই সম্ভাবনা নয়
  • ইউনিফর্ম বিতরণ — সবচেয়ে সরল কন্টিনিউয়াস বিতরণ
  • গাউসিয়ান PDF-এর সূত্র, এর প্যারামিটার ও আকৃতি
  • কেন গাউসিয়ান বিতরণ ML-এর সর্বত্র (নয়েজ মডেল, ওয়েট ইনিশিয়ালাইজেশন, MLE) দেখা যায়
  • NumPy দিয়ে PDF সূত্র বাস্তবায়ন, সংখ্যাগতভাবে ইন্টিগ্রেট করে যাচাই যে এটি $1$-এ পৌঁছায়

১ · PDF বনাম PMF

পাঠ ২৫-এ আমরা ডিসক্রিট র‍্যান্ডম ভেরিয়েবল দেখেছি, যেখানে $X$ শুধু গণনাযোগ্য কিছু মান নিতে পারত। কিন্তু অনেক বাস্তব পরিমাণ — উচ্চতা, তাপমাত্রা, একটি মডেলের ওজন — যেকোনো বাস্তব সংখ্যা (বা একটি নির্দিষ্ট ব্যবধিতে যেকোনো মান) নিতে পারে। এদের বলা হয় কন্টিনিউয়াস (continuous) র‍্যান্ডম ভেরিয়েবল।

একটি সমস্যা দেখা দেয় — একটি কন্টিনিউয়াস ভেরিয়েবলের কোনো একটি নির্দিষ্ট মান নেওয়ার সম্ভাবনা আসলে $0$ (অসীম সংখ্যক সম্ভাব্য মানের মধ্যে একটি বেছে নেওয়া)। তাই আমরা $P(X=x)$-এর বদলে একটি PDFProbability Density Functionএকটি কন্টিনিউয়াস র‍্যান্ডম ভেরিয়েবলের ঘনত্ব ফাংশন — সরাসরি সম্ভাবনা নয়, বরং একটি অঞ্চলে ইন্টিগ্রেট করলে সম্ভাবনা পাওয়া যায়। $f(x)$ ব্যবহার করি, এবং সম্ভাবনা পাই একটি ব্যবধিতে ইন্টিগ্রেট করে —

$$P(a\leq X\leq b)=\int_a^b f(x)\,dx$$

axiom মেনে চলার জন্য PDF-এর দুটি শর্ত পূরণ করতে হয়: $f(x)\geq0$ সব $x$-এর জন্য (নন-নেগেটিভিটি), এবং $\int_{-\infty}^{\infty}f(x)\,dx=1$ (নরমালাইজেশন — এটাই PMF-এর $\sum_k P(X=k)=1$-এর কন্টিনিউয়াস সংস্করণ)। লক্ষণীয় — $f(x)$ নিজে $1$-এর চেয়ে বড় হতে পারে (এটি ঘনত্ব, সম্ভাবনা নয়); শুধু তার ইন্টিগ্রাল $1$ হতে হবে।

সবচেয়ে সরল কন্টিনিউয়াস বিতরণ হলো ইউনিফর্ম (uniform) বিতরণ $U(a,b)$ — একটি ব্যবধি $[a,b]$-এর মধ্যে প্রতিটি বিন্দুতে সমান ঘনত্ব: $f(x)=\frac{1}{b-a}$ যদি $a\leq x\leq b$, নাহলে $0$। NumPy-র np.random.rand() মূলত $U(0,1)$ থেকে স্যাম্পল করে — যা আমরা আগের পাঠগুলোতে বারবার ব্যবহার করেছি।

২ · গাউসিয়ান/নরমাল বিতরণ

সবচেয়ে গুরুত্বপূর্ণ কন্টিনিউয়াস বিতরণ হলো গাউসিয়ান (Gaussian), যাকে নরমাল (Normal) বিতরণও বলা হয় — একটি ঘণ্টা-আকৃতির (bell-shaped) বক্ররেখা যা $\mu$-কে কেন্দ্র করে প্রতিসম। এর PDF —

$$f(x)=\frac{1}{\sqrt{2\pi\sigma^2}}\,e^{-\frac{(x-\mu)^2}{2\sigma^2}}$$

এখানে দুটি প্যারামিটার — $\mu$ (গড়/mean, বক্ররেখার কেন্দ্র নির্ধারণ করে) এবং $\sigma^2$ (ভেরিয়েন্স, বক্ররেখা কতটা "চওড়া" বা "সরু" তা নির্ধারণ করে — $\sigma$ বড় মানে বেশি ছড়ানো)। এক্সপোনেন্টের ভেতরের অংশ $-\frac{(x-\mu)^2}{2\sigma^2}$ নিশ্চিত করে $x=\mu$-তে সর্বোচ্চ ঘনত্ব (এক্সপোনেন্ট $0$, তাই $e^0=1$, সর্বোচ্চ মান), এবং $\mu$ থেকে যত দূরে যাওয়া যায় ঘনত্ব তত দ্রুত (স্কোয়ার-এক্সপোনেনশিয়াল হারে) কমতে থাকে। সামনের $\frac{1}{\sqrt{2\pi\sigma^2}}$ অংশটি শুধু একটি নরমালাইজিং ধ্রুবক — এটি নিশ্চিত করে পুরো ইন্টিগ্রাল $1$-এ পৌঁছায়।

যখন $\mu=0$ এবং $\sigma=1$, একে বলা হয় স্ট্যান্ডার্ড নরমাল বিতরণ $\mathcal{N}(0,1)$, এবং এর PDF সরল হয়ে যায় $f(z)=\frac{1}{\sqrt{2\pi}}e^{-z^2/2}$-এ। যেকোনো $\mathcal{N}(\mu,\sigma^2)$ থেকে একটি মানকে $z=\frac{x-\mu}{\sigma}$ রূপান্তর দিয়ে স্ট্যান্ডার্ড নরমালে "নরমালাইজ" করা যায় — এই কৌশলটি পরিসংখ্যানে বারবার ব্যবহৃত হয় (যেমন পাঠ ৩৩-এর হাইপোথিসিস টেস্টিং-এ)।

কেন গাউসিয়ান সর্বত্র?

তিনটি মূল কারণ। প্রথমত, গাণিতিক সুবিধা — গাউসিয়ানের সাথে যোগ, রৈখিক রূপান্তর, এবং কন্ডিশনিং করলে ফলাফল আবার গাউসিয়ান হয় (closed-form)। দ্বিতীয়ত, বহু মডেল সরাসরি অনুমান করে যে ডেটার নয়েজ গাউসিয়ান — যেমন লিনিয়ার রিগ্রেশনের ত্রুটি টার্ম (L35 ক্যাপস্টোন দেখুন)। তৃতীয়ত এবং সবচেয়ে গভীর কারণ — কেন্দ্রীয় সীমা উপপাদ্য (Central Limit Theorem, L29) বলে যে অনেক স্বাধীন র‍্যান্ডম ভেরিয়েবলের যোগফল/গড় — মূল বিতরণ যাই হোক না কেন — গাউসিয়ানের দিকে ঝোঁকে। তাই বাস্তবের বহু পরিমাপ (যা অনেক ছোট ছোট স্বাধীন কারণের সমষ্টি) স্বাভাবিকভাবেই প্রায়-গাউসিয়ান দেখায়।

৩ · মাল্টিভ্যারিয়েট গাউসিয়ান — সংক্ষিপ্ত ভূমিকা

যখন একসাথে একাধিক গাউসিয়ান-বিতরণকৃত ভেরিয়েবল থাকে (যেমন একটি ডেটাসেটের একাধিক ফিচার), তাদের যৌথ (joint) বিতরণকে মাল্টিভ্যারিয়েট গাউসিয়ান বলা হয়, যা একটি গড় ভেক্টর $\boldsymbol\mu$ এবং একটি কোভেরিয়েন্স ম্যাট্রিক্স $\boldsymbol\Sigma$ (পাঠ ২৭ ও ১২ দেখুন) দিয়ে সম্পূর্ণরূপে বর্ণনা করা যায়। এর সম্পূর্ণ PDF সূত্র এখানে না লিখেই বলা যায় — এক-চলকের গাউসিয়ানের $\sigma^2$-এর জায়গায় $\boldsymbol\Sigma$ বসে, এবং $\boldsymbol\Sigma$ অবশ্যই পজিটিভ সেমি-ডেফিনিট হতে হবে (পাঠ ১২-এ দেখেছি কেন — ভেরিয়েন্স কখনো ঋণাত্মক হতে পারে না)। এই ধারণাটি PCA (পাঠ ১১) ও Gaussian Mixture Model-এর মতো অ্যালগরিদমের ভিত্তি।

নিচের কোডে আমরা স্ট্যান্ডার্ড নরমাল $\mathcal{N}(0,1)$-এর PDF সূত্র সরাসরি বাস্তবায়ন করছি, তারপর একটি সূক্ষ্ম গ্রিডের উপর সংখ্যাগতভাবে ইন্টিগ্রেট (Riemann sum) করে যাচাই করছি এটি সত্যিই $1$-এ পৌঁছায় কি না — এবং সাথে সিমুলেশন দিয়ে "৬৮-৯৫-৯৯.৭ নিয়ম" (এক স্ট্যান্ডার্ড ডেভিয়েশনের মধ্যে থাকার সম্ভাবনা) যাচাই করছি।

Python · NumPy
import numpy as np

def gaussian_pdf(x, mu=0.0, sigma=1.0):
    coeff = 1.0 / np.sqrt(2 * np.pi * sigma**2)
    return coeff * np.exp(-((x - mu) ** 2) / (2 * sigma**2))

# ধাপ ১: PDF-এর মান কেন্দ্রে (x=mu) সর্বোচ্চ কি না দেখা
print("f(0)   =", round(gaussian_pdf(0.0), 5))   # সর্বোচ্চ ঘনত্ব
print("f(1)   =", round(gaussian_pdf(1.0), 5))
print("f(-1)  =", round(gaussian_pdf(-1.0), 5))  # প্রতিসাম্যের কারণে f(1)-এর সমান

# ধাপ ২: সংখ্যাগতভাবে ইন্টিগ্রেট করে মোট ক্ষেত্রফল ১ কি না যাচাই (Riemann sum)
xs = np.linspace(-10, 10, 200_000)
dx = xs[1] - xs[0]
total_area = np.sum(gaussian_pdf(xs)) * dx
print("মোট ক্ষেত্রফল (ইন্টিগ্রাল) ≈", round(total_area, 5))

# ধাপ ৩: সিমুলেশন দিয়ে P(-1 <= Z <= 1) যাচাই — তাত্ত্বিক মান ≈ 0.6827
samples = np.random.normal(0, 1, size=1_000_000)
within_one_std = np.mean((samples >= -1) & (samples <= 1))
print("P(-1<=Z<=1) সিমুলেশন থেকে ≈", round(within_one_std, 4))

    
লক্ষ করুন কোডের আউটপুটে f(0) ≈ 0.3989 — এটি $1$-এর চেয়ে অনেক ছোট, কিন্তু এটিই সর্বোচ্চ মান (কারণ $\frac{1}{\sqrt{2\pi}}\approx0.3989$)। এটি সম্ভাবনা নয়, ঘনত্ব — বিভ্রান্ত হবেন না। যদি $\sigma$ ছোট করা হয় (বক্ররেখা সরু হয়ে যায়), $f(0)$-এর মান $1$-এর চেয়েও বড় হয়ে যেতে পারে, কারণ তখন সরু হওয়ায় ইন্টিগ্রাল তবুও $1$-ই থাকে।

ভাবনার প্রশ্ন

প্রতিটি প্রশ্ন নিজে কিছুক্ষণ ভাবুন — তারপর "→ উত্তর" চাপুন।

প্র ০১ একজন বলল, "আমার মডেলের একটি ওজন প্যারামিটার গাউসিয়ান বিতরণ থেকে আসে, এবং $f(w)=1.2$ পাওয়া গেছে — তাই এই $w$-এর মান পাওয়ার সম্ভাবনা $120\%$!" এই বিবৃতির ভুলটা কোথায়?

$f(w)$ একটি ঘনত্ব, সম্ভাবনা নয় — এটি $1$-এর চেয়ে বড় হতেই পারে (বিশেষত $\sigma$ ছোট হলে)। কোনো একটি নির্দিষ্ট মান $w$ পাওয়ার প্রকৃত সম্ভাবনা আসলে $0$ (কন্টিনিউয়াস ভেরিয়েবল); অর্থবহ প্রশ্ন হলো একটি ব্যবধিতে (যেমন $w\in[0.9,1.1]$) থাকার সম্ভাবনা, যা $f$-কে সেই ব্যবধিতে ইন্টিগ্রেট করে বের করতে হয়।

প্র ০২ দুটি গাউসিয়ান বক্ররেখা আঁকা আছে — একটি সরু ও লম্বা, আরেকটি চ্যাপ্টা ও চওড়া। কোনটির $\sigma$ বড়, এবং কেন উভয়ের নিচের মোট ক্ষেত্রফল একই থাকে?

চ্যাপ্টা/চওড়া বক্ররেখাটির $\sigma$ বড় (মান আরও বেশি ছড়ানো)। উভয়ের ক্ষেত্রফল $1$-এই থাকতে হবে কারণ PDF-এর নরমালাইজেশন শর্ত ($\int f(x)dx=1$) যেকোনো বৈধ $\mu,\sigma$-এর জন্যই সত্য — সামনের $\frac{1}{\sqrt{2\pi\sigma^2}}$ ধ্রুবকটি ঠিক এই কারণেই আছে, যাতে $\sigma$ যাই হোক না কেন ক্ষেত্রফল সবসময় $1$-এ "ঠিক" হয়ে যায়।

প্র ০৩ কেন্দ্রীয় সীমা উপপাদ্যের কথা উল্লেখ করা হলো, কিন্তু সেটি এখনো প্রমাণ করা হয়নি। মূল দাবিটি এক বাক্যে কী?

দাবিটি হলো — যথেষ্ট সংখ্যক স্বাধীন র‍্যান্ডম ভেরিয়েবলের যোগফল বা গড়, তাদের নিজস্ব বিতরণ (Bernoulli, uniform, এমনকি খুবই বিকৃত কিছু) যাই হোক না কেন, প্রায় গাউসিয়ানের মতো আচরণ করতে শুরু করে। এই কোর্সে এটি পাঠ ২৯-এ পূর্ণাঙ্গভাবে বিবৃত ও সিমুলেশনের মাধ্যমে দেখানো হবে।

অনুশীলন

  1. হিসাব করুন: $\mathcal{N}(\mu=5,\sigma=2)$-এর জন্য $f(5)$ এর মান বের করুন এবং যাচাই করুন এটিই এই বিতরণের সর্বোচ্চ ঘনত্ব কি না।

    $x=\mu=5$ বসালে এক্সপোনেন্ট শূন্য হয়ে যায় ($e^0=1$), তাই $f(5)=\frac{1}{\sqrt{2\pi(2)^2}}=\frac{1}{\sqrt{8\pi}}\approx0.1995$। যেহেতু এক্সপোনেন্ট $-\frac{(x-\mu)^2}{2\sigma^2}\leq0$ সবসময়, $e^{(\cdot)}\leq1$ সবসময়, তাই $x=\mu$-তেই সর্বোচ্চ মান পাওয়া যায় — অন্য কোনো $x$-এ $f(x)$ এর চেয়ে বড় হতে পারে না।

  2. পরীক্ষা করুন: কোড সেলে gaussian_pdf ফাংশনে sigma=0.5 দিয়ে f(0) আবার হিসাব করুন। মানটি কি $\sigma=1$-এর তুলনায় বাড়ল না কমল, এবং কেন?

    মান বাড়বে ($f(0)=\frac{1}{\sqrt{2\pi(0.5)^2}}\approx0.7979$, যা আগের $0.3989$-এর দ্বিগুণ)। কারণ $\sigma$ ছোট মানে বক্ররেখা আরও সরু — কিন্তু ইন্টিগ্রাল তবুও $1$-ই থাকতে হবে, তাই সরু হলে বক্ররেখাকে কেন্দ্রের কাছে আরও "লম্বা" হতে হয় একই ক্ষেত্রফল বজায় রাখতে।

আরও পড়ুন · ABCL TECH-এ আপনার পরবর্তী পদক্ষেপ

পূর্ববর্তী পাঠ
ডিসক্রিট বিতরণ — Bernoulli, Binomial, Poisson