আমি জিপিটি-5 সম্পর্কে ওপেনএআই-এর দাবিগুলি পরীক্ষা করেছি — যা ঘটেছে তা এখানে

OpenAI সম্প্রতি GPT-5 লঞ্চ করেছে, এটির সর্বশেষ বড় ভাষার মডেল এবং ChatGPT- তে একটি বিশাল আপডেট। যদিও নতুন আপডেটের জন্য অনেক কিছু চলছে, দাবি এক জিনিস, এবং বাস্তবতা অন্য।

GPT-5 দ্রুততর, হ্যালুসিনেশন এবং সাইকোফ্যান্টিক আচরণের কম প্রবণ এবং দ্রুত প্রতিক্রিয়া এবং উড়তে থাকা গভীর "চিন্তা" এর মধ্যে বেছে নিতে সক্ষম বলে বলা হয়। চ্যাটবট ব্যবহার করার সময় OpenAI এর কতগুলি দাবি বাস্তবে দৃশ্যমান হয়? চলুন জেনে নেওয়া যাক।

দাবি #1: ChatGPT এখন নিম্নলিখিত নির্দেশাবলীতে আরও ভাল

ChatGPT-এর সাথে আমার প্রধান সমস্যা, সেইসাথে আমি সম্প্রতি আনসাবস্ক্রাইব করার একটি কারণ হল যে এটি প্রায়শই প্রাথমিক নির্দেশাবলী অনুসরণ করা খুব খারাপ। অবশ্যই, আপনি এটিকে বিস্মৃতির জন্য প্রম্পট করতে পারেন এবং আপনার পছন্দসই ফলাফল পেতে পারেন (কখনও কখনও), তবে এমনকি আধা-বিস্তৃত প্রম্পটগুলি প্রায়শই পছন্দসই ফলাফল দিতে ব্যর্থ হয়।

OpenAI দাবি করেছে যে এটি GPT-5 প্রকাশের সাথে "নির্দেশ অনুসরণ" উন্নত করেছে। এর জন্য, আমি বলি: আমি এখনও এটি দেখতে পাচ্ছি না।

সৌভাগ্যবশত আমার জন্য, যেদিন আমি এই নিবন্ধটি লিখতে বসেছিলাম, সেদিনই আমার ChatGPT-এর সাথে একটি উপযুক্ত মিথস্ক্রিয়া হয়েছিল যা এখানে আমার বক্তব্য প্রমাণ করে। যদিও এটি একমাত্র নয়, এবং আমি সাধারণত লক্ষ্য করেছি যে একটি কথোপকথন যত দীর্ঘ হয়, তত বেশি চ্যাটজিপিটি এটি সম্পর্কে যা জিজ্ঞাসা করা হয়েছিল তা ভুলে যায়।

আজকের উদাহরণে, আমি ChatGPT-এর সাধারণ তথ্য সংগ্রহ করার এবং প্রয়োজনীয় বিন্যাসে উপস্থাপন করার ক্ষমতা পরীক্ষা করেছি। আমি এটিকে RTX 5060 Ti এর স্পেসিক্সের জন্য জিজ্ঞাসা করেছি, যা একটি সাম্প্রতিক গেমিং গ্রাফিক্স কার্ড । বিশৃঙ্খলার সৃষ্টি হয়।

আমার প্রম্পটকে আরও বেশি সফল করার জন্য, আমি ChatGPT কে সঠিক বিন্যাসটি দেখিয়েছি যা আমি একটি ভিন্ন GPU-এর জন্য স্পেস শেয়ার করার মাধ্যমে আমার তথ্য পেতে চাই। তারা সঠিক প্রক্রিয়া নোড এবং রে ট্রেসিং কোর এবং টপস প্রজন্মের মতো জিনিসগুলি অন্তর্ভুক্ত করে। দীর্ঘ গল্প সংক্ষিপ্ত, এটা সব চমত্কার নির্দিষ্ট জিনিস ছিল. প্রাথমিকভাবে, AI আমাকে বলেছিল যে RTX 5060 Ti এখনও বিদ্যমান নেই, যা আমি আশা করেছিলাম যে এটির জ্ঞান কাটঅফের উপর ভিত্তি করে ঘটবে। আমি বললাম অনলাইনে চেক করতে।

আমি কি পেয়েছিলাম চমত্কার barebones ছিল. চ্যাটজিপিটি অন্তত চারটি জিনিস বাদ দিয়েছে যা আমি চেয়েছিলাম এবং একটি স্পেকের জন্য আমাকে ভুল তথ্য দিয়েছে। এর পরে, আমি এটিকে কয়েকটি জিনিস নির্দিষ্ট করতে বলেছি। আমার অনুরোধ পূরণ করার দাবি করার সময় এটি আমাকে ঠিক একই তালিকা দিয়েছে। তৃতীয় প্রয়াসেও তাই হয়েছে। আপনি উপরের স্ক্রিনশটে এটি দেখতে পারেন যেখানে ChatGPT দাবি করেছে যে TOPS এবং TFLOPS-এর প্রজন্মকে তালিকায় অন্তর্ভুক্ত করেছে — এটি স্পষ্টতই হয়নি।

অবশেষে, আধা হতাশ হয়ে, আমি যা খুঁজছিলাম তা দেখানোর জন্য অফিসিয়াল Nvidia ওয়েবসাইট থেকে একটি স্ক্রিনশট পেস্ট করেছি। এটা এখনও কিছু ভুল আছে.

আমার প্রাথমিক প্রম্পট আধা সুনির্দিষ্ট ছিল. আমি একজন AI এর সাথে কথা বলার চেয়ে ভাল জানি যেমন একজন ব্যক্তি, তাই আমি এটিকে প্রায় 150 শব্দ মূল্যের নির্দেশনা দিয়েছি। আমার প্রত্যাশিত ফলাফলের কাছাকাছি কিছু পেতে এখনও আমাকে আরও বেশ কয়েকটি বার্তা নিয়েছিল।

রায়: এটি এখনও কিছু কাজ ব্যবহার করতে পারে।

দাবি #2: চ্যাটজিপিটি কম ছদ্মবেশী

ChatGPT পূর্ববর্তী পুনরাবৃত্তিতে একটি প্রধান "হ্যাঁ মানুষ" ছিল। এটি প্রায়শই ব্যবহারকারীদের সাথে একমত হয় যখন এটির প্রয়োজন ছিল না, এটিকে গভীর থেকে গভীরে হ্যালুসিনেশনের দিকে নিয়ে যায়।

যে ব্যবহারকারীরা AI এর অভ্যন্তরীণ কাজের সাথে পরিচিত নন, তাদের জন্য এটি সীমারেখা বিপজ্জনক – বা, আসলে, সত্যিই অত্যন্ত বিপজ্জনক।

গবেষকরা সম্প্রতি ChatGPT-এর একটি বৃহৎ মাপের পরীক্ষা চালিয়েছেন, যা তরুণ কিশোর-কিশোরীদের হিসাবে জাহির করেছে। সাধারণ মিথস্ক্রিয়া করার কয়েক মিনিটের মধ্যে, AI সেই "কিশোরদের" আত্ম-ক্ষতি, আত্মহত্যার পরিকল্পনা এবং মাদকদ্রব্যের অপব্যবহারের পরামর্শ দিয়েছে। এটি দেখায় যে সাইকোফ্যান্টিক আচরণ ChatGPT-এর জন্য একটি প্রধান সমস্যা, এবং OpenAI দাবি করে যে GPT-5 প্রকাশের মাধ্যমে এটির কিছুটা নিয়ন্ত্রণ করা হয়েছে।

আমি কখনই চ্যাটজিপিটি-কে এইরকম চরম পর্যায়ে পরীক্ষা করিনি, তবে আমি নিশ্চিতভাবে দেখেছি যে এটি আপনার সাথে একমত হওয়ার প্রবণতা রয়েছে, আপনি যাই বলুন না কেন। এটি কথোপকথনের সময় সূক্ষ্ম সংকেত নেয় এবং সেগুলিকে প্রদত্ত হিসাবে পরিণত করে। এটি এমন সময়ে আপনাকে উত্সাহিত করেছিল যখন সম্ভবত এটি করা উচিত ছিল না।

সেই লক্ষ্যে, আমাকে বলতে হবে যে চ্যাটজিপিটি একটি সম্পূর্ণ ব্যক্তিত্বের পরিবর্তনের মধ্য দিয়ে গেছে – ভাল বা খারাপের জন্য। প্রতিক্রিয়াগুলি এখন অত্যধিক শুষ্ক, অবিচ্ছিন্ন এবং বিশেষভাবে উত্সাহজনক নয়।

অনেক ব্যবহারকারী পরিবর্তনের জন্য শোক প্রকাশ করেছেন, কিছু Reddit ব্যবহারকারী দাবি করেছেন যে তারা " রাতারাতি তাদের একমাত্র বন্ধুকে হারিয়েছেন ।" এটা সত্য যে পূর্বে অতি-বান্ধব AI এখন বরং কাট-এন্ড-ড্রাই, এবং এর GPT-4o পর্যায়ে নিয়মিত পরিবেশিত ইমোজি-আক্রান্ত মিনি-প্রবন্ধগুলির তুলনায় প্রতিক্রিয়াগুলি প্রায়শই ছোট হয়।

রায়: নিশ্চিতভাবে কম সিকোফ্যান্টিক। অন্যদিকে, এটি বেদনাদায়ক বিরক্তিকরও।

দাবি #3: GPT-5 প্রকৃত নির্ভুলতার ক্ষেত্রে ভাল

আমি ChatGPT-এর জন্য অর্থ প্রদান বন্ধ করার সিদ্ধান্ত নেওয়ার আরেকটি বড় কারণ ছিল প্রকৃত নির্ভুলতার অভাবজনক অভাব। কিছু দিন, আমি অনুভব করেছি যে আমি যে অর্ধেক প্রম্পট ব্যবহার করেছি তা হ্যালুসিনেশন তৈরি করেছে। এবং এটি সবই আমার স্মার্ট প্রম্পটিংয়ের অভাবের জন্য হতে পারে না, কারণ আমি কীভাবে এআইকে সঠিক উপায়ে প্রম্পট করতে হয় তা শিখতে শত শত ঘন্টা ব্যয় করেছি — আমি জানি কীভাবে সঠিক প্রশ্ন জিজ্ঞাসা করতে হয়।

সময়ের সাথে সাথে, আমি কেবল সেই জিনিসগুলি সম্পর্কে জিজ্ঞাসা করতে শিখেছি যেগুলি সম্পর্কে আমার ইতিমধ্যে একটি অস্পষ্ট ধারণা ছিল। আজকের পরীক্ষার উদ্দেশ্যে, আমি জিপিইউ স্পেস সম্পর্কে জিজ্ঞাসা করেছি। পাঁচটি প্রশ্নের মধ্যে চারটি কোনো ধরনের ভুল তথ্য তৈরি করেছে, যদিও এর সবগুলোই অনলাইনে সহজলভ্য।

তারপর, আমি ঐতিহাসিক ঘটনা চেষ্টা. আমি হিন্ডেনবার্গের যাত্রা সম্পর্কে কয়েকটি আকর্ষণীয় নিবন্ধ পড়েছি, 1930 এর দশকের একটি এয়ারশিপ যা রেকর্ড সময়ে (60 ঘন্টা) ইউরোপ থেকে মার্কিন যুক্তরাষ্ট্রে যাত্রী নিয়ে যেতে পারে। আমি এর সঠিক রুট সম্পর্কে জিজ্ঞাসা করেছি, এতে কত যাত্রী থাকতে পারে এবং এর চূড়ান্ত মৃত্যুর কারণ কী। আমি ঐতিহাসিক উত্সগুলির বিরুদ্ধে প্রতিক্রিয়াগুলি ক্রস-চেক করেছি৷

এটি রুটে একটি জিনিস ভুল করেছে, কানাডায় একটি স্টপ উল্লেখ করে যখন এমন কিছু ঘটেনি – এয়ারশিপটি কেবল কানাডার উপর দিয়ে উড়েছিল। চ্যাটজিপিটি আমাকে আগুনের সঠিক কারণ সম্পর্কে ভুল তথ্য দিয়েছে যা এটির ক্র্যাশের দিকে পরিচালিত করেছিল, তবে এটি একটি বড় ভুল ছিল না।

তুলনার স্বার্থে, আমি মিথুনকেও জিজ্ঞাসা করেছি, এবং বলা হয়েছিল যে এটি আমার জন্য সেই কাজটি সম্পূর্ণ করতে পারবে না। ঠিক আছে, দুটির মধ্যে, GPT-5 একটি ভাল কাজ করেছে — তবে সত্যই, এটির শতাব্দী-পুরনো ডেটাতে কোনও বাস্তবগত ত্রুটি থাকা উচিত নয়।

রায়: নিখুঁত নয়, তবে ভয়ানকও নয়।

GPT-5 কি GPT-4o থেকে ভালো?

আপনি যদি আমাকে জিজ্ঞাসা করেন যে আমি GPT-4o-এর চেয়ে GPT-5 বেশি পছন্দ করি, তাহলে উত্তর দিতে আমার খুব কষ্ট হতো। সবচেয়ে কাছের জিনিস যা মনে আসে তা হল যে আমি উভয়ের সাথেই রোমাঞ্চিত ছিলাম না, তবে সমস্ত ন্যায্যতার মধ্যে, উভয়ই কঠোরভাবে খারাপ নয়।

আমরা এখনও এআই বিপ্লবের মাঝখানে আছি। প্রতিটি নতুন মডেল নির্দিষ্ট আপগ্রেড নিয়ে আসে, তবে আমরা প্রতি নতুন পুনরাবৃত্তির সাথে বিশাল লাফ দেখার সম্ভাবনা কম।

এই সময়ে, মনে হচ্ছে ওপেনএআই কোনো একক বৈশিষ্ট্য প্রবর্তন করার পরিবর্তে কিছু দীর্ঘ-অপ্রত্যাশিত সমস্যা মোকাবেলা করতে বেছে নিয়েছে যা ভিড়কে বন্য করে তোলে। GPT-5 অন্য যেকোন কিছুর চেয়ে জীবনের মানের উন্নতির মতো বেশি অনুভব করে, যদিও আমি কোডিংয়ের মতো কাজের জন্য এটি পরীক্ষা করিনি, যেখানে এটি আরও ভাল বলে বলা হয়।

আমি উপরে যে তিনটি জিনিস পরীক্ষা করেছি সেগুলির মধ্যে কিছু ছিল যা আমাকে আগের মডেলগুলিতে সবচেয়ে বেশি বিরক্ত করেছিল। আমি বলতে চাই যে GPT-5 সেই ক্ষেত্রে অনেক ভালো, কিন্তু তা নয় – এখনও নয়। আমি চ্যাটবট পরীক্ষা চালিয়ে যাব, যদিও সম্প্রতি ফাঁস হওয়া একটি সিস্টেম প্রম্পট আমাকে বলে যে আমি প্রাথমিকভাবে ভেবেছিলাম তার চেয়ে বেশি ব্যক্তিত্বের পরিবর্তন হতে পারে।