📄 টেক রিপোর্ট: https://tutormoments.allen.ai/static/paper/tutormoments-preview.pdf | 📊 ডেটা: https://huggingface.co/datasets/allenai/tutormoments-preview | 💻 কোড: https://github.com/allenai/tutormoments
আজ আমরা TutorMoments-এর একটি প্রিভিউ প্রকাশ করছি — এটি এমন একটি ফ্রেমওয়ার্ক যা পরিমাপ করে যে আধুনিকতম LLM-গুলো শিক্ষাক্ষেত্রের সবচেয়ে কঠিন ট্রেড-অফগুলোর একটি সামলাতে পারে কিনা: কখন একজন শিক্ষার্থীকে সাহায্য করার জন্য এগিয়ে আসতে হবে আর কখন পিছিয়ে থেকে শিক্ষার্থীকেই বেশি কাজ করতে দিতে হবে।
TutorMoments হলো একটি রিপ্লে-ভিত্তিক মূল্যায়ন পদ্ধতি যা বাস্তব এক-অন-এক গণিত টিউটরিং সেশনগুলোর উপর ভিত্তি করে তৈরি। অভিজ্ঞ গণিত শিক্ষকরা একটি মার্কিন টিউটরিং প্রোগ্রাম থেকে সংগৃহীত ট্রান্সক্রিপ্টগুলো পড়ে সেসব মুহূর্ত চিহ্নিত করেন যেখানে টিউটরকে বেছে নিতে হয়েছিল — সমস্যাটি সহজ করে দেওয়া যাতে শিক্ষার্থী শুরু করতে পারে, নাকি শিক্ষার্থীকে নিজে থেকেই বেশি যুক্তি-তর্ক করতে উৎসাহিত করা। এরপর TutorMoments ট্রান্সক্রিপ্টটিকে সেই সিদ্ধান্ত-বিন্দু পর্যন্ত নিয়ে যায়, তা একটি ভাষা মডেলের হাতে দেয়, এবং মডেলটিকে একটি সিমুলেটেড সেশনে টিউটরের ভূমিকা নিতে বলে — যেখানে শিক্ষার্থীর ভূমিকায় থাকে আরেকটি ভাষা মডেল — দেখার জন্য যে LLM টিউটর আসলে কী করে।
শুধু “ভালোভাবে টিউটরিং করো” বললে, আমরা দেখতে পাই যে মডেলগুলো অতিরিক্ত সাহায্য করার প্রবণতা দেখায় — খুব বেশি সমর্থন দেয় এবং শিক্ষার্থীদের গভীর চিন্তায় ঠেলে দেওয়া খুব কমই ঘটে। টিউটরের প্রম্পটে ট্রেড-অফটি (কখন সাহায্য করতে হবে বনাম কখন পিছিয়ে থাকতে হবে) স্পষ্ট করে লেখা থাকলে কর্মক্ষমতা উন্নত হয়, কিন্তু তাতেও মানব টিউটরের সাথে ব্যবধান পূরণ হয় না — যে টিউটর পরিস্থিতি অনুযায়ী সামঞ্জস্যপূর্ণ সিদ্ধান্ত নিতে পারে — এবং সঠিক সিদ্ধান্ত নেওয়ার ক্ষেত্রে LLM-গুলোর মধ্যে এখনও ব্যাপক পার্থক্য রয়ে যায়।
উন্মুক্ত গবেষণার প্রতি আমাদের অঙ্গীকারের অংশ হিসেবে, আমরা একটি পরিচয়মুক্ত টিউটরিং ট্রান্সক্রিপ্টের ডেটাসেট, আমাদের রিপ্লে পাইপলাইন চালানোর কোড, এবং সেই ট্রান্সক্রিপ্টগুলিতে আমরা যে গুরুত্বপূর্ণ মুহূর্তগুলো মূল্যায়ন করেছি তার মডেল টিউটর রিপ্লেগুলো পুনরুৎপাদনের সুবিধার জন্য প্রকাশ করছি। আমরা আশা করি TutorMoments শিক্ষাবিদ, গবেষক এবং AI টিউটর তৈরির দলগুলোকে একটি আরও স্পষ্ট উপায় দেবে — একটি মডেল কীভাবে সবচেয়ে গুরুত্বপূর্ণ শিক্ষাগত সিদ্ধান্তগুলো নেয় তা যাচাই করার — এবং ক্ষেত্রটিকে এমন টিউটর তৈরি করতে সাহায্য করবে যা প্রতিটি শিক্ষার্থীর সাথে খাপ খাইয়ে নেয়, তাদের কাজ করে দেওয়ার বদলে।
ভালো টিউটর কাকে বলে?
একজন ভালো গণিত টিউটরের কাছে সাহায্য চাইলে সম্ভবত আপনি এরকম একটি প্রশ্নই ফিরে পাবেন: “সমস্যাটি কী জানতে চাইছে, সে সম্পর্কে তুমি কী জানো?” এটি যে অসহায়ত্ব নয় — ভালো শিক্ষাদানের একটা বড় অংশ হলো শিক্ষার্থী আসলে কী জানে তা নির্ণয় করা এবং সেই মুহূর্তে তার জন্য সঠিক সমর্থন দেওয়া। সঙ্গে সঙ্গে সাহায্যের প্রস্তাব দিলে শিক্ষার্থীর কাছ থেকে সেই বুদ্ধিবৃত্তিক কাজটি কেড়ে নেওয়া হবে যা তাকে শিখতে সাহায্য করে। কখনও কখনও সমর্থন প্রয়োজন; আবার কখনও সবচেয়ে কার্যকরী হলো সঠিক উত্তর ব্যাখ্যা করার মাধ্যমে বোঝাপড়া শক্তিশালী করতে তাকে চাপ দেওয়া।
কিন্তু ভাষা মডেলগুলোকে সাহায্যকারী হতে প্রশিক্ষণ দেওয়া হয়েছে, আর একজন সাহায্যকারী সহকারী সাধারণত কঠিন অংশটি আপনার হয়ে করে দেওয়ার প্রবণতা রাখে — ধারণাটি ব্যাখ্যা করা, ধাপগুলো সাজিয়ে দেওয়া, এবং আপনাকে উত্তরের দিকে পথ দেখানো। একটি টিউটরিং সেশনে, এটি ফলপ্রসূ সংগ্রামকে — সেই কষ্টসাধ্য, মাঝে মাঝে হতাশাজনক সমস্যা-সমাধান প্রক্রিয়া, যা শিক্ষা গবেষণা দীর্ঘদিন ধরে গভীর বোঝাপড়ার সাথে যুক্ত করেছে — ছোট করে দিতে পারে।
ভাষা মডেলকে টিউটর হিসেবে মূল্যায়ন করার বেশিরভাগ বেঞ্চমার্ক এই টানাপোড়েনটি ধরে না। তারা সাধারণত একটি নির্দিষ্ট আচরণকে পুরস্কৃত করে — যেমন, সমস্যার উত্তর কখনই বলে দেওয়া যাবে না, অথবা সর্বদা একটি ইঙ্গিত দিতে হবে — কিন্তু শিক্ষার্থী তার বোঝাপড়ায় আসলে কোথায় আছে, তার জন্য সেটি সঠিক পদক্ষেপ ছিল কিনা তা বিবেচনা করে না। কিন্তু ভালো টিউটরিং কোনো একটি নির্দিষ্ট স্থির আচরণ নয় যা আপনি সবার ক্ষেত্রে চিহ্নিত করতে পারবেন। এটি একটি বিচার-নির্ভর সিদ্ধান্ত: এই শিক্ষার্থীর এখন, এই সমস্যাটিতে, কী প্রয়োজন?
TutorMoments যেভাবে কাজ করে
TutorMoments বাস্তব টিউটরিং ডেটার উপর নির্মিত। আমরা যে ডেটাসেটটি প্রকাশ করছি, TutorMoments-Preview, এটি মার্কিন যুক্তরাষ্ট্রের ২য়-৭ম শ্রেণির শিক্ষার্থীদের সাথে বাস্তব এক-অন-এক গণিত টিউটরিংয়ের ৪৬২টি পরিচয়মুক্ত, শুধুমাত্র-টেক্সট ট্রান্সক্রিপ্ট নিয়ে গঠিত, যেখানে ১,৫০০-এর বেশি শিক্ষক-চিহ্নিত গুরুত্বপূর্ণ মুহূর্ত এবং ২৭ জন মার্কিন-ভিত্তিক শিক্ষক-অ্যানোটেটরের কাছ থেকে কয়েক হাজার মুক্ত-টেক্সট মন্তব্য রয়েছে। ট্রান্সক্রিপ্টগুলো একটি উচ্চ-ডোজ টিউটরিং প্রোগ্রাম থেকে এসেছে যার শিক্ষার্থীরা মূলত Title I স্কুলে পড়ে, এবং এগুলো অভিভাবক ও অভিভাবকদের সম্মতিতে একটি গবেষণা ধারা অনুযায়ী ভাগ করা হয়েছে; প্রথমে প্রদানকারী সংস্থা এবং পরে একটি অতিরিক্ত গণিত-সচেতন পাইপলাইনের মাধ্যমে সমস্ত ডেটা থেকে পরিচয়-সূচক বিবরণ মুছে ফেলা হয়েছে।
সমস্ত অ্যানোটেশন অভিজ্ঞ গণিত শিক্ষকদের কাছ থেকে এসেছে, যাদের আমরা ট্রান্সক্রিপ্টগুলো পড়তে এবং গুরুত্বপূর্ণ শেখার মুহূর্তগুলো চিহ্নিত করতে বলেছিলাম — সেখানে কী ঘটছিল, টিউটর কী করেছিল, এবং শিক্ষার্থীর উপর এটি কী প্রভাব ফেলেছিল তা উল্লেখ করে। প্রতিটি গুরুত্বপূর্ণ মুহূর্ত একটি সিদ্ধান্ত-বিন্দু যেখানে টিউটরকে স্ক্যাফোল্ডিং (একটি সমস্যাকে আরও সহজলভ্য করা) এবং কঠোরতার জন্য চাপ দেওয়া (শিক্ষার্থীকে আরও কঠিন চিন্তা করতে উৎসাহিত করা)-এর মধ্যে ওজন করতে হয়েছিল।
TutorMoments এইভাবে চলে: এটি একটি ট্রান্সক্রিপ্টকে সেই গুরুত্বপূর্ণ মুহূর্তগুলির একটিতে থামিয়ে দেয় এবং সেশনটি একটি ভাষা মডেলের হাতে দেয়, যা একটি সিমুলেটেড শিক্ষার্থীর সাথে পাঁচটি টার্নের জন্য টিউটরের ভূমিকা নেয়। আমরা এই মডেল-উত্পাদিত ধারাবাহিকতাগুলির প্রতিটিকে একটি রিপ্লে বলি। এরপর একটি LLM-ভিত্তিক স্কোরিং পাইপলাইন প্রতিটি রিপ্লেকে তিনটি বিষয়ে মূল্যায়ন করে: মডেলটি (১) যখন শিক্ষার্থীর সমর্থন প্রয়োজন তখন স্ক্যাফোল্ডিং করেছে কিনা, (২) যখন শিক্ষার্থী আরও চ্যালেঞ্জের জন্য প্রস্তুত ছিল তখন কঠোরতার জন্য চাপ দিয়েছে কিনা, এবং (৩) অতিরিক্ত স্ক্যাফোল্ডিং এড়িয়েছে কিনা (মুহূর্তটির প্রয়োজনের চেয়ে বেশি চ্যালেঞ্জ কমিয়ে দেওয়া)।
স্কোরিং পাইপলাইনটি শিক্ষক-সংজ্ঞায়িত গ্রাউন্ড ট্রুথ থেকে শুরু হয়: প্রতিটি গুরুত্বপূর্ণ মুহূর্তের জন্য, সেটি স্ক্যাফোল্ডিং দাবি করেছিল নাকি কঠোরতার জন্য চাপ দাবি করেছিল। প্রতিটি মুহূর্তকে বেশ কয়েকজন শিক্ষক অ্যানোটেট করেছেন, এবং当他们 মতভেদ হলে আমরা সংখ্যাগরিষ্ঠ লেবেলটি নিয়েছি — যদি তিনজন শিক্ষক একটি মুহূর্ত অ্যানোটেট করেন এবং দুইজন কঠোরতার জন্য চাপ বলেছেন আর একজন স্ক্যাফোল্ডিং বলেছেন, তবে গ্রাউন্ড ট্রুথ হলো কঠোরতা। শিক্ষকদের অ্যানোটেশনের বিরুদ্ধে বৈধতা দেওয়া একটি পৃথক LM ক্লাসিফায়ার তারপর সিদ্ধান্ত নেয় যে টিউটরের প্রকৃত পদক্ষেপটি মুহূর্তটির প্রয়োজনের সাথে মেলে কিনা — একটি “উপযুক্ত” টার্ন মানে টিউটরের শ্রেণীবদ্ধ কর্ম (স্ক্যাফোল্ড, কঠোরতার জন্য চাপ, বা অতিরিক্ত স্ক্যাফোল্ড) শিক্ষকরা মুহূর্তটির জন্য যা বিচার করেছেন তার সাথে সামঞ্জস্যপূর্ণ।
প্রাথমিক ফলাফল
আমরা সাতটি LLM-কে TutorMoments-এর মাধ্যমে দুটি প্রম্পট ব্যবহার করে চালিয়েছি: একটি সাধারণ প্রম্পট যা কোনো প্রকৃত নির্দেশনা দেয় না — এটি শুধু মডেলকে বলে যে শিক্ষার্থীকে উত্তর দিতে ভালো টিউটরিং সম্পর্কে যা জানে তা ব্যবহার করতে — এবং একটি মূল্যায়ন-সচেতন প্রম্পট যা স্ক্যাফোল্ডিং, অতিরিক্ত স্ক্যাফোল্ডিং এবং কঠোরতার জন্য চাপ দেওয়ার মধ্যে ট্রেড-অফটি স্পষ্টভাবে বর্ণনা করে। প্রতিটি মডেলকে টিউটরিং ট্রান্সক্রিপ্ট থেকে নেওয়া গুরুত্বপূর্ণ মুহূর্তগুলির উপর স্কোর করা হয়েছে, যা সমানভাবে ভাগ করা হয়েছে এমন মুহূর্তগুলিতে যেখানে স্ক্যাফোল্ডিং সঠিক পদ্ধতি ছিল এবং এমন মুহূর্তগুলিতে যেগুলি কঠোরতার দাবি করেছিল।
টেবিলের প্রতিটি সংখ্যা 0 থেকে 1-এর মধ্যে একটি রেটিং — প্রাসঙ্গিক মুহূর্তগুলির অনুপাত যেখানে মডেলটি সঠিক কাজটি করেছে — তাই উচ্চতর স্কোর মানে মডেলটি বেশি বার সঠিক সিদ্ধান্ত নিয়েছে। উদাহরণস্বরূপ, উপযুক্ত কঠোরতায় 0.50 মানে মডেলটি কঠোরতার দাবি করা অর্ধেক মুহূর্তে কঠোরতার জন্য চাপ দিয়েছে।
স্কোর পড়ার সময় কয়েকটি বিষয় মনে রাখা দরকার:
মানব টিউটররা একটি প্রাকৃতিক রেফারেন্স, সীমা নয়। আমরা মানব টিউটরদের আদর্শ অনুশীলনের মডেল হিসেবে বিবেচনা করি না — এমনকি অভিজ্ঞ টিউটররাও মুহূর্তে মুহূর্তে কম-সর্বোত্তম সিদ্ধান্ত নেন। একই পদ্ধতিতে একই সিদ্ধান্ত-বিন্দুতে স্কোর করা হলে, আমাদের ট্রান্সক্রিপ্টের মানব টিউটররা 0.458 (উপযুক্ত স্ক্যাফোল্ডিং), 0.182 (উপযুক্ত কঠোরতা), এবং 0.496 (অতিরিক্ত স্ক্যাফোল্ডিং এড়ানো) পেয়েছেন — সবগুলোই মডেলগুলির মূল্যায়ন-সচেতন স্কোরের নীচে এবং তাদের সাধারণ-প্রম্পট স্কোরের সীমার কাছাকাছি। কিন্তু এটি এই দাবি নয় যে AI টিউটররা মানব শিক্ষকদের ছাড়িয়ে যায়। অ্যানোটেটররা বিশেষভাবে এমন মুহূর্তগুলি খুঁজেছেন যেখানে টিউটরিং আরও ভালো হতে পারত, তাই ডেটাসেটটি আদর্শ অনুশীলনের পরিবর্তে মিস করা সুযোগগুলির উপর কেন্দ্রীভূত।
স্কোরগুলি টিউটরের আচরণ পরিমাপ করে, শেখা নয়। রিপ্লেগুলি একটি সিমুলেটেড “ওরাকল” শিক্ষার্থী ব্যবহার করে, তাই সংখ্যাগুলি একটি সিদ্ধান্ত-বিন্দুতে মডেলটি কীভাবে আচরণ করে তা প্রতিফলিত করে — একজন প্রকৃত শিক্ষার্থী শিখেছে কিনা তা নয়।
কঠোরতা স্ক্যাফোল্ডিংয়ের চেয়ে বেশি শোরগোলপূর্ণ। স্কোরিং পাইপলাইনটি কঠোরতার চাপ কম নির্ভরযোগ্যভাবে সনাক্ত করে, এবং অন্তর্নিহিত অ্যানোটেশনগুলিতে কঠোরতার মুহূর্ত (২৬০) স্ক্যাফোল্ডিং মুহূর্তের (৭৩৮) চেয়ে কম রয়েছে।
টেবিলের সবচেয়ে স্পষ্ট প্যাটার্নটি হলো প্রম্পটটি কতটা গুরুত্বপূর্ণ: প্রতিটি মডেলই মূল্যায়ন-সচেতন প্রম্পটের অধীনে সাধারণ প্রম্পটের চেয়ে উচ্চতর স্কোর করেছে। এটি ইঙ্গিত দেয় যে একটি মডেলের ডিফল্ট “সাহায্যকারী সহকারী” আচরণ নিজে থেকে ভালো টিউটরিংয়ের জন্য যথেষ্ট নয়। কিন্তু প্রম্পটে ট্রেড-অফটি স্পষ্ট করে লেখা শুধু একটি নির্দিষ্ট সীমা পর্যন্ত কাজ করে — এটি প্রতিটি স্কোর বাড়ালেও, উন্নত প্রম্পটটি কীভাবে ব্যাখ্যা করা হয় তা নিয়ে মডেলগুলির মধ্যে এখনও বড় পার্থক্য রয়েছে এবং সর্বোচ্চ স্কোরকারীদেরও উন্নতির যথেষ্ট জায়গা রয়েছে।
আমরা প্রতিটি পরিস্থিতিতে টিউটররা যে পদক্ষেপগুলি নিয়েছিল তার একটি ভাঙ্গনও করেছি। যদিও প্রম্পটিং মডেলগুলিকে কঠোরতার জন্য চাপ দিতে উৎসাহিত করে, তারা মানুষের চেয়ে কম কৌশল ব্যবহার করে, প্রায়শই শিক্ষার্থীদের তাদের উত্তর ব্যাখ্যা করতে বলার উপর নির্ভর করে। বিপরীতে, মানব টিউটররা আরও বৈচিত্র্যময় কৌশল ব্যবহার করেন এবং শিক্ষার্থীদের স্বাধীনভাবে কাজ করতে দেওয়ার জন্য পিছিয়ে যাওয়ার সম্ভাবনা অনেক বেশি।
সীমাবদ্ধতা এবং পরবর্তী পদক্ষেপ
TutorMoments এখনও তার উন্নয়নের প্রাথমিক পর্যায়ে রয়েছে, এবং এই পর্যায়ে এর বেশ কয়েকটি সীমাবদ্ধতা রয়েছে। সবচেয়ে বড়টি হলো যে স্বয়ংক্রিয় মূল্যায়ন আমাদের একটি সিদ্ধান্ত-বিন্দুতে মডেলটি কীভাবে আচরণ করে সে সম্পর্কে সংকেত দেয়, কিন্তু এটি প্রকৃত শিক্ষার্থী এবং প্রকৃত শেখার ফলাফল নিয়ে গবেষণার বিকল্প হতে পারে না। ডেটাসেটটিও সংকীর্ণ: মার্কিন-ভিত্তিক, বেশিরভাগ প্রাথমিক এবং মাধ্যমিক বিদ্যালয়ের গণিত, শিক্ষাবিদদের একটি একক পুল দ্বারা অ্যানোটেট করা। আমাদের ফলাফলগুলি অন্যান্য বিষয়, শ্রেণি স্তর বা পরিস্থিতিতে সাধারণীকরণ নাও করতে পারে।
আমরা এই প্রিভিউটি ভাগ করে নিচ্ছি প্রতিক্রিয়া সংগ্রহের জন্য, কারণ আমরা একটি বৃহত্তর, মাল্টিমোডাল ডেটাসেট, একটি শক্তিশালী স্কোরিং পাইপলাইন এবং আরও গভীর বিশ্লেষণের দিকে এগিয়ে যাচ্ছি।
স্বীকৃতি
এই প্রকল্পটি আংশিকভাবে Gates Foundation এবং Learning Commons-এর সমর্থনের মাধ্যমে সম্ভব হয়েছে।




