
সবকিছুই এমন যেন এতে একটি V12 ইঞ্জিন রয়েছে।
এই মাসের 13 তারিখে, কাই-ফু লি এবং জিরো ওয়ান উইশ তার দ্বিতীয় পণ্য, Yi-লার্জ ক্লোজড-সোর্স মডেল প্রকাশ করেছে। প্রকাশের অর্ধেক মাসেরও কম সময়ের মধ্যে, Yi-Large একটি নতুন প্রজন্ম থেকে চলে গেছে যারা বাঘকে ভয় পায় না এমন একটি শক্তিশালী দলে পরিণত হয়েছে যারা ইয়াংজি নদীর ঢেউয়ের চেয়ে এগিয়ে।
গত সপ্তাহে, "im-also-a-good-gpt2-chatbot" নামের একটি রহস্যময় মডেল হঠাৎ করে বড় মডেল এরিনা চ্যাটবট এরেনায় হাজির হয়েছে, GPT-4-Turbo, Gemini 1 .5 Pro, Claude 3 0pus এর থেকে সরাসরি র্যাঙ্কিং করেছে। Llama-3-70b এবং প্রধান আন্তর্জাতিক নির্মাতাদের অন্যান্য জনপ্রিয় বেস মডেল।
এই রহস্যময় মডেলটি হল GPT-4o-এর পরীক্ষামূলক সংস্করণ ওপেনএআই-এর সিইও স্যাম অল্টম্যানও ব্যক্তিগতভাবে GPT-4o প্রকাশের পর LMSYS এরিনা ব্লাইন্ড পরীক্ষার ফলাফল উদ্ধৃত করেছেন।

এক সপ্তাহ পরে, সর্বশেষ আপডেট করা র্যাঙ্কিং-এ, "im-also-a-gpt2-chatbot" এর ডার্ক হর্স স্টোরিটি আবার মঞ্চস্থ করা হয়েছে, যে মডেলটি র্যাঙ্কিংয়ে দ্রুত বেড়েছে তা বড় চীনাদের দ্বারা জমা দেওয়া হয়েছে৷ মডেল কোম্পানি জিরো ওয়ান "ই-লার্জ" ক্লোজড-সোর্স বৃহৎ মডেল যার শত শত বিলিয়ন প্যারামিটার রয়েছে।
LMSYS ব্লাইন্ড টেস্ট এরিনার সর্বশেষ র্যাঙ্কিংয়ে, Yi-Large, Yi-Large-এর সর্বশেষ 100 বিলিয়ন প্যারামিটার মডেল, বিশ্বের 7তম এবং চীনের বড় মডেলগুলির মধ্যে 1ম স্থানে রয়েছে, Llama-3-70B এবং Claude 3 সনেটকে ছাড়িয়ে গেছে। এর চীনা র্যাঙ্কিং বিশ্বের প্রথম স্থানের জন্য GPT4o-এর সাথে সংযুক্ত।
ওপেন রিসার্চ অর্গানাইজেশন LMSYS Org (Large Model Systems Orgization) দ্বারা প্রকাশিত Chatbot Arena, OpenAI, Anthropic, Google, এবং Meta-এর মতো বড় আন্তর্জাতিক কোম্পানিগুলির জন্য একটি হেড টু হেড প্রতিযোগিতায় পরিণত হয়েছে এবং একটি গণভোটিং ফাংশনও খুলেছে। .
লিঙ্গিউউউ এইভাবে একমাত্র বড় চীনা মডেল কোম্পানিতে পরিণত হয়েছে যার নিজস্ব মডেল সামগ্রিক তালিকায় শীর্ষ দশে রয়েছে।
সামগ্রিক তালিকায়, GPT সিরিজের জন্য শীর্ষ 10 টির মধ্যে 4টি রয়েছে। প্রতিষ্ঠান অনুসারে সাজানো, 01W01.AI ওপেনএআই, গুগল এবং অ্যানথ্রপিকের পরেই দ্বিতীয়, এবং আনুষ্ঠানিকভাবে বিশ্বের শীর্ষ বড় মডেল এন্টারপ্রাইজ ক্যাম্পে প্রবেশ করেছে।
এখন মনে হচ্ছে "বিশ্বের এক নম্বর হও" স্লোগানটি শুধু স্লোগান নয়, হয়ে উঠছে।
চীনা স্কোর বিশ্বে প্রথম স্থানে রয়েছে এবং "মস্তিষ্ক-বার্নিং" অন্ধ পরীক্ষা বিশ্বে দ্বিতীয় স্থানে রয়েছে।
LMSYS চ্যাটবোট এরিনা অন্ধ পরীক্ষার ফলাফল, যা এইমাত্র 20 মে, 2024, ইউএস সময় আপডেট করা হয়েছে, এখন পর্যন্ত 11.7 মিলিয়নেরও বেশি বিশ্বব্যাপী ব্যবহারকারীর প্রকৃত ভোট থেকে এসেছে।

এটি উল্লেখ করার মতো যে চ্যাটবট এরিনা প্রশ্নের সামগ্রিক গুণমান উন্নত করার জন্য, LMSYS একটি অনুলিপি প্রক্রিয়াও প্রয়োগ করেছে এবং অপ্রয়োজনীয় প্রশ্নগুলি সরিয়ে দেওয়ার পরে একটি তালিকা জারি করেছে।
এই নতুন প্রক্রিয়াটি অত্যধিক অপ্রয়োজনীয় ব্যবহারকারীর প্রম্পটগুলি দূর করার জন্য ডিজাইন করা হয়েছে, যেমন অত্যধিক পুনরাবৃত্তিমূলক "হ্যালো" যা র্যাঙ্কিংয়ের সঠিকতাকে প্রভাবিত করতে পারে।
LMSYS প্রকাশ্যে বলেছে যে অপ্রয়োজনীয় প্রশ্নগুলি সরানোর পরে তালিকাটি ভবিষ্যতে ডিফল্ট তালিকায় পরিণত হবে৷
অপ্রয়োজনীয় প্রশ্নগুলি মুছে ফেলার পর সামগ্রিক তালিকায়, Yi-Large-এর Elo স্কোর আরও এগিয়েছে, Claude 3 Opus এবং GPT-4-0125-প্রিভিউ সহ চতুর্থ স্থানে রয়েছে।

সামগ্রিক তালিকা ছাড়াও, LMSYS ইংরেজি, চীনা এবং ফরাসি ভাষায় তিনটি নতুন ভাষা মূল্যায়ন যুক্ত করেছে এবং বিশ্বব্যাপী বড় মডেলের বৈচিত্র্যের উপর ফোকাস করতে শুরু করেছে। Yi-Large চীনা ভাষার তালিকায় প্রথম স্থান অধিকার করেছে, Qwen-Max এবং GLM-4 চীনা ভাষার তালিকায়ও ভালো পারফর্ম করেছে।
বৃহৎ দেশীয় মডেল নির্মাতাদের মধ্যে, Alibaba-এর Qwen-Max এবং Zhipu-এর GLM-4 উভয়ই অসাধারণভাবে পারফর্ম করেছে।

ক্যাটাগরি র্যাঙ্কিং-এও Yi-Large ভালো পারফর্ম করে। প্রোগ্রামিং ক্ষমতার তিনটি মূল্যায়ন, দীর্ঘ প্রশ্ন এবং সর্বশেষ "কঠিন প্রম্পট শব্দ" হল এলএমএসওয়াইএস দ্বারা প্রদত্ত লক্ষ্যবস্তু তালিকাগুলি তাদের পেশাদারিত্ব এবং উচ্চ অসুবিধার জন্য তাদের "সর্বাধিক মস্তিষ্ক-জ্বলন্ত" জনসাধারণের অন্ধত্ব বলা যেতে পারে . মাপা.
প্রোগ্রামিং ক্ষমতার তিনটি মূল্যায়ন, দীর্ঘ প্রশ্ন এবং সর্বশেষ "কঠিন প্রম্পট শব্দ" পেশাদার এবং কঠিন এটি LMSYS তালিকায় "সবচেয়ে মস্তিষ্ক-জ্বলন্ত" পাবলিক ব্লাইন্ড পরীক্ষা হিসেবেও পরিচিত।
প্রোগ্রামিং ক্ষমতা (কোডিং) র্যাঙ্কিংয়ে, Yi-Large-এর Elo স্কোর অ্যানথ্রপিকের ক্লাউড 3 ওপাসকে ছাড়িয়ে গেছে, এটি GPT-4o-এর চেয়ে কম এবং GPT-4-Turbo এবং GPT-4 এর সাথে দ্বিতীয় স্থানে রয়েছে;

দীর্ঘ ক্যোয়ারী তালিকায়, Yi-Large এছাড়াও GPT-4-Turbo, GPT-4, এবং Claude 3 Opus-এর সাথে আবদ্ধ, বিশ্বের দ্বিতীয় স্থানে রয়েছে;

হার্ড প্রম্পট তালিকায়, Yi-Large GPT-4-Turbo, GPT-4, এবং Claude 3 Opus-এর সাথে দ্বিতীয় স্থানে আছে।

উদ্দেশ্যমূলক ফলাফল পেতে বৈজ্ঞানিক পদ্ধতি ব্যবহার করুন
কিভাবে বড় মডেলের বস্তুনিষ্ঠ ও ন্যায্য মূল্যায়ন প্রদান করা যায় তা সর্বদাই শিল্পে ব্যাপক উদ্বেগের বিষয়।
পূর্বে, শিল্পে "র্যাঙ্কিং সোয়াইপ করার" বিভিন্ন পদ্ধতি ছিল, কিন্তু তারা সবসময়ই বড় মডেলের প্রকৃত ক্ষমতা প্রতিফলিত করতে অক্ষম হয়েছে, যারা কুয়াশার মধ্যে বুঝতে চায় এবং সংশ্লিষ্ট শিল্পে বিনিয়োগকারীরা তাদের মাথা ঘামাচ্ছে। .
LMSYS Org দ্বারা প্রকাশিত চ্যাটবট এরিনা এই বিশৃঙ্খলা ভাঙতে শুরু করে।
এর নভেল "এরেনা" ফরম্যাট এবং টেস্টিং টিমের কঠোরতার সাথে, এটি বৈশ্বিক শিল্প দ্বারা স্বীকৃত একটি মাপকাঠিতে পরিণত হয়েছে।
ওপেনএআই-এর প্রতিষ্ঠাতা দলের সদস্য আন্দ্রেজ কার্পাথি, এমনকি প্রকাশ্যে বলেছেন:
চ্যাটবট এরিনা দুর্দান্ত।

ফর্মের পরিপ্রেক্ষিতে, চ্যাটবট এরিনা সার্চ ইঞ্জিন যুগের অনুভূমিক তুলনামূলক মূল্যায়ন ধারণাগুলিকে আঁকে:
- প্রথমত, মূল্যায়নের জন্য আপলোড করা সমস্ত "প্রবেশ" মডেলগুলি এলোমেলোভাবে জোড়ায় জোড়ায় জোড়ায় জোড়ায় এবং বেনামী মডেলের আকারে ব্যবহারকারীদের কাছে উপস্থাপন করা হয়;
- তারপর প্রকৃত ব্যবহারকারীদের তাদের নিজস্ব প্রম্পট শব্দ লিখতে বলা হয় এবং প্রকৃত ব্যবহারকারীরা মডেলের নাম না জেনেই দুটি মডেলের পণ্যের উত্তর মূল্যায়ন করবে;
- তারপরে অন্ধ পরীক্ষার প্ল্যাটফর্ম https://arena.lmsys.org/-এ, বড় মডেলগুলি জোড়ায় তুলনা করা হয়, এবং ব্যবহারকারী স্বাধীনভাবে বড় মডেল সম্পর্কে প্রশ্নগুলি ইনপুট করে;
- মডেল A এবং মডেল B উভয় পক্ষের যথাক্রমে দুটি PK মডেলের প্রকৃত ফলাফল তৈরি করে ব্যবহারকারীরা চারটির মধ্যে একটি বেছে নিতে ফলাফলের নীচে ভোট দিতে পারেন: মডেল A ভাল/মডেল B ভাল/উভয়ই বাঁধা/উভয়ই ভাল নয়;
- জমা দেওয়ার পরে, পিকে পরবর্তী রাউন্ড পরিচালনা করা যেতে পারে।

অনলাইন রিয়েল-টাইম ব্লাইন্ড টেস্টিং এবং বেনামী ভোটিং পরিচালনা করার জন্য প্রকৃত ব্যবহারকারীদের ক্রাউডফান্ডিং করে, চ্যাটবট এরিনা একদিকে পক্ষপাতের প্রভাব কমায়, অন্যদিকে এটি পরীক্ষার সেটের উপর ভিত্তি করে র্যাঙ্কিং এড়ানোর সম্ভাবনাকেও সর্বাধিক করে তোলে, যার ফলে বস্তুনিষ্ঠতা বৃদ্ধি পায়। চূড়ান্ত ফলাফলের।
চ্যাটবট এরিনা সমস্ত ব্যবহারকারীর ভোটিং ডেটা পরিষ্কার এবং বেনামী করার পরে সর্বজনীন করে তোলে।
প্রকৃত ব্যবহারকারী ভোটিং ডেটা সংগ্রহ করার পর, LMSYS চ্যাটবট এরিনা মডেলের কর্মক্ষমতা পরিমাপ করতে, স্কোরিং প্রক্রিয়াটিকে আরও অপ্টিমাইজ করতে এবং অংশগ্রহণকারীদের শক্তিকে মোটামুটিভাবে প্রতিফলিত করার জন্য ইলো স্কোরিং সিস্টেম ব্যবহার করবে।
ইলো স্কোরিং সিস্টেমে, প্রতিটি অংশগ্রহণকারী একটি বেসলাইন স্কোর পায় এবং প্রতিটি খেলার পরে, খেলার ফলাফলের উপর ভিত্তি করে অংশগ্রহণকারীর স্কোর সমন্বয় করা হয়।
সিস্টেমটি অংশগ্রহণকারীর রেটিং এর উপর ভিত্তি করে একটি কম স্কোরিং প্লেয়ার একটি উচ্চ স্কোরিং প্লেয়ারকে পরাজিত করলে, কম স্কোরিং প্লেয়ার আরও পয়েন্ট পাবে এবং এর বিপরীতে।

ইলো স্কোরিং সিস্টেম চালু করার মাধ্যমে, LMSYS চ্যাটবট এরিনা র্যাঙ্কিংয়ের বস্তুনিষ্ঠতা এবং ন্যায্যতা নিশ্চিত করে।
বড় জিততে ছোট ব্যবহার করুন
এইবার চ্যাটবট এরেনায় মোট 44টি মডেল অংশগ্রহণ করেছে, যার মধ্যে শীর্ষস্থানীয় ওপেন সোর্স মডেল Llama3-70B এবং প্রধান নির্মাতাদের ক্লোজড সোর্স মডেল রয়েছে।

- সর্বশেষ Elo স্কোর বিচার করে, GPT-4o 1287 স্কোর নিয়ে তালিকার শীর্ষে রয়েছে;
- GPT-4-Turbo, Gemini 1 5 Pro, Claude 3 0pus, Yi-Large এবং অন্যান্য মডেলগুলি প্রায় 1240 স্কোর সহ দ্বিতীয় স্তরে রয়েছে;
- পরবর্তীকালে, বার্ড (জেমিনি প্রো), লামা-3-70বি-ইন্সট্রাক্ট এবং ক্লদ 3 সনেটের স্কোর একটি ক্লিফ থেকে প্রায় 1200 পয়েন্টে নেমে যায়।
উল্লেখ্য যে শীর্ষ 6 মডেলগুলি বিদেশী জায়ান্টগুলির অন্তর্গত যথাক্রমে জিরো ওয়ান থাউজেন্ড থিংস বিশ্বে চতুর্থ স্থানে রয়েছে এবং GPT-4 এবং জেমিনি 1.5 প্রো-এর সবকটিই ট্রিলিয়ন-স্তরের প্যারামিটার রয়েছে৷ স্কেলের ফ্ল্যাগশিপ মডেল, এবং অন্যান্য মডেলগুলিও শত শত বিলিয়নের প্যারামিটার স্তরে রয়েছে।
Yi-লার্জ "বড় জিততে ছোট লাগে", শুধুমাত্র 100 বিলিয়ন প্যারামিটার স্তরের সাথে ঘনিষ্ঠভাবে অনুসরণ করে।

AI বড় মডেলগুলির প্রতিযোগিতামূলক বিকাশ এখনও একটি মারাত্মক পর্যায়ে রয়েছে, এবং কৃত্রিম বুদ্ধিমত্তার "শত মডেলের যুদ্ধ" এই ক্ষেত্রে মঞ্চস্থ হতে থাকবে যেখানে "সপ্তাহ" বা এমনকি "দিন" পুনরাবৃত্তি ইউনিট হিসাবে ব্যবহৃত হয়, একটি অপেক্ষাকৃত ন্যায্য এবং বস্তুনিষ্ঠ মূল্যায়ন ব্যবস্থা আছে এটি বিশেষভাবে গুরুত্বপূর্ণ হয়ে ওঠে।
একটি মূল্যায়ন প্ল্যাটফর্ম যা ক্রমাগত স্কোরিং সিস্টেম আপডেট করে তা কেবল শিল্প বিনিয়োগকারীদের প্রযুক্তিগত উন্নয়নের প্রকৃত অবস্থা দেখতে দেয় না, তবে ব্যবহারকারীদের উন্নত মডেলগুলি বেছে নেওয়ার অধিকারও দেয় এবং সমগ্র বৃহৎ মডেল শিল্পের সুস্থ বিকাশকেও প্রচার করতে পারে। .
এটি তাদের নিজস্ব মডেল ক্ষমতার পুনরাবৃত্তির জন্য হোক বা দীর্ঘমেয়াদী খ্যাতির দৃষ্টিকোণ থেকে, বড় মডেল নির্মাতাদের প্রকৃত ব্যবহারকারীর প্রতিক্রিয়া এবং পেশাদার মূল্যায়ন প্রক্রিয়ার মাধ্যমে তাদের পণ্যগুলি প্রমাণ করার জন্য চ্যাটবট এরিনার মতো অনুমোদিত মূল্যায়ন প্ল্যাটফর্মে সক্রিয়ভাবে অংশগ্রহণ করা উচিত।
বিপরীতে, আপনি যদি শুধুমাত্র র্যাঙ্কিংয়ের ফলাফলের প্রতি যত্নবান হন এবং মডেলের বাস্তব প্রয়োগের প্রভাবকে উপেক্ষা করেন, তাহলে মডেলের ক্ষমতা এবং বাজারের চাহিদার মধ্যে ব্যবধান আরও স্পষ্ট হয়ে উঠবে এবং শেষ পর্যন্ত ভয়ঙ্কর AI-তে পা রাখা কঠিন হবে। বাজার প্রতিযোগিতা।
এআই যুগের তরঙ্গে, যদি বড় মডেল নির্মাতারা দুর্দান্ত বা এমনকি শীর্ষস্থানীয় হতে চান তবে তাদের কমপক্ষে দুটি গুণের প্রয়োজন:
- আমাকে প্রতিদিন তিনবার নিজেকে পরীক্ষা করতে হবে: অগ্রগতির মাধ্যমে অভিজ্ঞতা অর্জন করতে হবে এবং প্রতিযোগিতার মাধ্যমে উত্তর পেতে হবে;
- সত্যিকারের সোনা আগুনকে ভয় পায় না: "বন্য তালিকায়" প্রথম হওয়ার চেয়ে, ভিতরের দিকে তাকানো এবং আপনার সত্যিকারের ক্ষমতা উন্নত করা ভাল।
অপেক্ষা করার মতো বিষয় হল এখন চমৎকার দেশীয় বৃহৎ-স্কেল মডেল নির্মাতাদের একটি গ্রুপ রয়েছে যারা ডাউন-টু-আর্থ, গবেষণা এবং উন্নয়নে উদ্ভাবন করছে এবং এমনকি আন্তর্জাতিক মঞ্চে শিল্প জায়ান্টদের সাথে প্রতিযোগিতা করতে পারে।
LMSYS চ্যাটবট এরিনা ব্লাইন্ড টেস্ট এরিনা পাবলিক ভোটিং ঠিকানা: https://arena.lmsys.org/
LMSYS চ্যাটবট লিডারবোর্ড মূল্যায়ন র্যাঙ্কিং (রোলিং আপডেট): https://chat.lmsys.org/?leaderboard
# Aifaner এর অফিসিয়াল WeChat পাবলিক অ্যাকাউন্ট অনুসরণ করতে স্বাগতম: Aifaner (WeChat ID: ifanr) যত তাড়াতাড়ি সম্ভব আপনাকে আরও উত্তেজনাপূর্ণ সামগ্রী সরবরাহ করা হবে।
