AI Course

রিইনফোর্সমেন্ট লার্নিংReinforcement Learning — agents that learn by doing

AI কীভাবে নিজে নিজে শেখে — পুরস্কার ও শাস্তি দিয়ে। AlphaGo, ChatGPT-এর RLHF, রোবট নিয়ন্ত্রণ — সব কিছুর পেছনের মূল ধারণা ও অ্যালগরিদম।

উচ্চ · Advanced Deep Learning বাংলায় ফ্রি
পাঠ ০১ থেকে শুরু করুন

এই কোর্সে যা শিখবেন What you'll learn

MDP ও Bellman সমীকরণ — RL-এর গাণিতিক ভিত্তি
Value iteration, Policy iteration
Q-learning ও SARSA
DQN — Deep Q-Network
Policy gradient — REINFORCE, A2C
PPO ও TRPO — আধুনিক policy methods
Actor-Critic ও SAC
RLHF — LLM-এর alignment-এর কৌশল
Multi-agent RL ও game theory

কোর্সের কাঠামো Course outline

৪টি মডিউলে ভাগ — ভিত্তি, value-based, policy-based, ও আধুনিক RL।

M1RL-এর ভিত্তিRL foundations
L01
RL কী, অন্য ML থেকে কেন আলাদা
What is RL
৬মি
পড়ুন
L02
Agent, Environment, Reward — মূল অনুঘটক
Agent & environment
৬মি
পড়ুন
L03
Markov Decision Process (MDP)
Markov Decision Process
৮মি
পড়ুন
L04
Value function ও Q-function
Value & Q functions
৭মি
পড়ুন
L05
Bellman সমীকরণ — RL-এর হৃদয়
Bellman equations
৮মি
পড়ুন
L06
Exploration বনাম Exploitation
Exploration vs exploitation
৬মি
পড়ুন
L07
Multi-armed bandit সমস্যা
Multi-armed bandits
৭মি
পড়ুন
M2Value-based পদ্ধতিValue-based methods
L08
Value Iteration
Value iteration
৭মি
পড়ুন
L09
Policy Iteration
Policy iteration
৭মি
পড়ুন
L10
Monte Carlo methods
Monte Carlo methods
৭মি
পড়ুন
L11
Temporal Difference (TD) learning
TD learning
৮মি
পড়ুন
L12
Q-learning ও SARSA
Q-learning & SARSA
৮মি
পড়ুন
L13
Deep Q-Network (DQN)
Deep Q-Networks
৯মি
পড়ুন
L14
Experience Replay ও Target Network
Replay & target networks
৭মি
পড়ুন
L15
Double DQN ও Dueling DQN
Double & Dueling DQN
৭মি
পড়ুন
M3Policy-based ও Actor-CriticPolicy methods
L16
Policy Gradient theorem
Policy gradient theorem
৮মি
পড়ুন
L17
REINFORCE অ্যালগরিদম
REINFORCE algorithm
৭মি
পড়ুন
L18
Actor-Critic মডেল
Actor-Critic
৭মি
পড়ুন
L19
A2C ও A3C
A2C & A3C
৭মি
পড়ুন
L20
TRPO — trust region
TRPO
৭মি
পড়ুন
L21
PPO — clipped objective
PPO
৮মি
পড়ুন
L22
SAC — Soft Actor-Critic
SAC
৭মি
পড়ুন
L23
DDPG ও TD3
DDPG & TD3
৭মি
পড়ুন
M4আধুনিক RL ও বাস্তব প্রয়োগModern RL & applications
L24
Model-based RL
Model-based RL
৭মি
পড়ুন
L25
MCTS ও AlphaZero
MCTS & AlphaZero
৮মি
পড়ুন
L26
Multi-agent RL
Multi-agent RL
৭মি
পড়ুন
L27
Inverse RL ও imitation learning
Inverse RL & imitation
৭মি
পড়ুন
L28
RLHF — LLM alignment-এর কৌশল
RLHF for LLMs
৮মি
পড়ুন
L29
DPO ও RLAIF
DPO & RLAIF
৭মি
পড়ুন
L30
প্রজেক্ট: CartPole agent
Project: CartPole agent
১৫মি
পড়ুন
L31
প্রজেক্ট: Atari game-এ DQN
Project: Atari with DQN
১৫মি
পড়ুন
L32
কোর্সের চূড়ান্ত পর্যালোচনা
Course capstone
১০মি
পড়ুন