AI Course
রিইনফোর্সমেন্ট লার্নিংReinforcement Learning — agents that learn by doing
AI কীভাবে নিজে নিজে শেখে — পুরস্কার ও শাস্তি দিয়ে। AlphaGo, ChatGPT-এর RLHF, রোবট নিয়ন্ত্রণ — সব কিছুর পেছনের মূল ধারণা ও অ্যালগরিদম।
পাঠ ০১ থেকে শুরু করুনএই কোর্সে যা শিখবেন What you'll learn
MDP ও Bellman সমীকরণ — RL-এর গাণিতিক ভিত্তি
Value iteration, Policy iteration
Q-learning ও SARSA
DQN — Deep Q-Network
Policy gradient — REINFORCE, A2C
PPO ও TRPO — আধুনিক policy methods
Actor-Critic ও SAC
RLHF — LLM-এর alignment-এর কৌশল
Multi-agent RL ও game theory
কোর্সের কাঠামো Course outline
৪টি মডিউলে ভাগ — ভিত্তি, value-based, policy-based, ও আধুনিক RL।
M1RL-এর ভিত্তিRL foundations
M2Value-based পদ্ধতিValue-based methods
M3Policy-based ও Actor-CriticPolicy methods
M4আধুনিক RL ও বাস্তব প্রয়োগModern RL & applications