চীনা স্কোর বিশ্বে প্রথম স্থান অধিকার করেছে, এবং এটি একাধিক অন্ধ পরীক্ষায় GPT4o-এর সাথে যুক্ত হয়েছে কীভাবে এই বৃহৎ দেশীয় মডেলটি এআই বিশ্বে একটি অন্ধকার ঘোড়া হয়ে উঠেছে?

সবকিছুই যেন এতে V12 ইঞ্জিন রয়েছে।

এই মাসের 13 তারিখে, কাই-ফু লি এবং জিরো ওয়ান উইশ তার দ্বিতীয় পণ্য, Yi-লার্জ ক্লোজড-সোর্স মডেল প্রকাশ করেছে। প্রকাশের অর্ধেকেরও কম সময়ের মধ্যে, Yi-Large একটি নতুন প্রজন্ম থেকে চলে গেছে যারা বাঘকে ভয় পায় না এমন একটি শক্তিশালী দলে পরিণত হয়েছে যা ইয়াংজি নদীর ঢেউয়ের চেয়ে এগিয়ে।

গত সপ্তাহে, "im-also-a-good-gpt2-chatbot" নামের একটি রহস্যময় মডেল হঠাৎ করে বড় মডেল এরিনা চ্যাটবট এরেনায় হাজির হয়েছে, GPT-4-Turbo, Gemini 1 .5 Pro, Claude 3 0pus এর থেকে সরাসরি র‍্যাঙ্কিং করেছে। Llama-3-70b এবং প্রধান আন্তর্জাতিক নির্মাতাদের অন্যান্য জনপ্রিয় বেস মডেল।

এই রহস্যময় মডেলটি হল GPT-4o-এর পরীক্ষামূলক সংস্করণ ওপেনএআই-এর সিইও স্যাম অল্টম্যানও ব্যক্তিগতভাবে GPT-4o প্রকাশের পর LMSYS এরিনা ব্লাইন্ড পরীক্ষার ফলাফল উদ্ধৃত করেছেন।

এক সপ্তাহ পরে, সর্বশেষ আপডেট করা র‍্যাঙ্কিং-এ, "im-also-a-gpt2-chatbot" এর ডার্ক হর্স স্টোরিটি আবার মঞ্চস্থ করা হয়েছে, যে মডেলটি র‍্যাঙ্কিংয়ে দ্রুত বেড়েছে তা বড় চীনাদের দ্বারা জমা দেওয়া হয়েছে৷ মডেল কোম্পানি জিরো ওয়ান "ই-লার্জ" ক্লোজড-সোর্স বৃহৎ মডেল যার শত শত বিলিয়ন প্যারামিটার রয়েছে।

LMSYS ব্লাইন্ড টেস্ট এরিনার সর্বশেষ র‍্যাঙ্কিংয়ে, Yi-Large, Yi-Large-এর সর্বশেষ 100 বিলিয়ন প্যারামিটার মডেল, বিশ্বের 7তম এবং চীনের বড় মডেলগুলির মধ্যে 1ম স্থানে রয়েছে, Llama-3-70B এবং Claude 3 সনেটকে ছাড়িয়ে গেছে। এর চীনা র‍্যাঙ্কিং বিশ্বের প্রথম স্থানের জন্য GPT4o-এর সাথে সংযুক্ত।

ওপেন রিসার্চ অর্গানাইজেশন LMSYS Org (Large Model Systems Orgization) দ্বারা প্রকাশিত Chatbot Arena, OpenAI, Anthropic, Google, এবং Meta-এর মতো বড় আন্তর্জাতিক কোম্পানিগুলির জন্য একটি হেড টু হেড প্রতিযোগিতায় পরিণত হয়েছে এবং একটি গণভোটিং ফাংশনও খুলেছে। .

লিঙ্গিউউউ এইভাবে একমাত্র বড় চীনা মডেল কোম্পানিতে পরিণত হয়েছে যার নিজস্ব মডেল সামগ্রিক তালিকায় শীর্ষ দশে রয়েছে।

সামগ্রিক তালিকায়, GPT সিরিজের জন্য শীর্ষ 10 টির মধ্যে 4টি রয়েছে। প্রতিষ্ঠান অনুসারে সাজানো, 01W01.AI ওপেনএআই, গুগল এবং অ্যানথ্রপিকের পরেই দ্বিতীয়, এবং আনুষ্ঠানিকভাবে বিশ্বের শীর্ষ বড় মডেল এন্টারপ্রাইজ ক্যাম্পে প্রবেশ করেছে।

এখন মনে হচ্ছে "বিশ্বের এক নম্বর হও" স্লোগানটি শুধু স্লোগান নয়, হয়ে উঠছে।

চীনা স্কোর বিশ্বে প্রথম স্থানে রয়েছে এবং "মস্তিষ্ক-বার্নিং" অন্ধ পরীক্ষা বিশ্বে দ্বিতীয় স্থানে রয়েছে।

LMSYS চ্যাটবোট এরিনা অন্ধ পরীক্ষার ফলাফল, যা এইমাত্র 20 মে, 2024, ইউএস সময় আপডেট করা হয়েছে, এখন পর্যন্ত 11.7 মিলিয়নেরও বেশি বিশ্বব্যাপী ব্যবহারকারীর প্রকৃত ভোট থেকে এসেছে।

এটি উল্লেখ করার মতো যে চ্যাটবট এরিনা প্রশ্নের সামগ্রিক গুণমান উন্নত করার জন্য, LMSYS একটি অনুলিপি প্রক্রিয়াও প্রয়োগ করেছে এবং অপ্রয়োজনীয় প্রশ্নগুলি সরিয়ে দেওয়ার পরে একটি তালিকা জারি করেছে।

এই নতুন প্রক্রিয়াটি অত্যধিক অপ্রয়োজনীয় ব্যবহারকারীর প্রম্পটগুলি দূর করার জন্য ডিজাইন করা হয়েছে, যেমন অত্যধিক পুনরাবৃত্তিমূলক "হ্যালো" যা র্যাঙ্কিংয়ের সঠিকতাকে প্রভাবিত করতে পারে।

LMSYS প্রকাশ্যে বলেছে যে অপ্রয়োজনীয় প্রশ্নগুলি সরানোর পরে তালিকাটি ভবিষ্যতে ডিফল্ট তালিকায় পরিণত হবে৷

অপ্রয়োজনীয় প্রশ্নগুলি মুছে ফেলার পর সামগ্রিক তালিকায়, Yi-Large-এর Elo স্কোর আরও এগিয়েছে, Claude 3 Opus এবং GPT-4-0125-প্রিভিউ সহ চতুর্থ স্থানে রয়েছে।

সামগ্রিক তালিকা ছাড়াও, LMSYS ইংরেজি, চীনা এবং ফরাসি ভাষায় তিনটি নতুন ভাষা মূল্যায়ন যুক্ত করেছে এবং বিশ্বব্যাপী বড় মডেলের বৈচিত্র্যের উপর ফোকাস করতে শুরু করেছে। Yi-Large চীনা ভাষার তালিকায় প্রথম স্থান অধিকার করেছে, Qwen-Max এবং GLM-4 চীনা ভাষার তালিকায়ও ভালো পারফর্ম করেছে।

বৃহৎ দেশীয় মডেল নির্মাতাদের মধ্যে, Alibaba-এর Qwen-Max এবং Zhipu-এর GLM-4 উভয়ই অসাধারণভাবে পারফর্ম করেছে।

ক্যাটাগরি র‌্যাঙ্কিংয়েও Yi-Large ভালো পারফর্ম করে। প্রোগ্রামিং ক্ষমতার তিনটি মূল্যায়ন, দীর্ঘ প্রশ্ন এবং সর্বশেষ "কঠিন প্রম্পট শব্দ" হল এলএমএসওয়াইএস দ্বারা প্রদত্ত লক্ষ্যবস্তু তালিকাগুলি তাদের পেশাদারিত্ব এবং উচ্চ অসুবিধার জন্য তাদের "সর্বাধিক মস্তিষ্ক-জ্বলন্ত" জনসাধারণের অন্ধত্ব বলা যেতে পারে . মাপা.

প্রোগ্রামিং ক্ষমতার তিনটি মূল্যায়ন, দীর্ঘ প্রশ্ন এবং সর্বশেষ "কঠিন প্রম্পট শব্দ" পেশাদার এবং কঠিন এটি LMSYS তালিকায় "সবচেয়ে মস্তিষ্ক-জ্বলন্ত" পাবলিক ব্লাইন্ড পরীক্ষা হিসেবেও পরিচিত।

প্রোগ্রামিং ক্ষমতা (কোডিং) র‌্যাঙ্কিংয়ে, Yi-Large-এর Elo স্কোর অ্যানথ্রপিকের ক্লাউড 3 ওপাসকে ছাড়িয়ে গেছে, এটি GPT-4o-এর চেয়ে কম এবং GPT-4-Turbo এবং GPT-4 এর সাথে দ্বিতীয় স্থানে রয়েছে;

দীর্ঘ ক্যোয়ারী তালিকায়, Yi-Large এছাড়াও GPT-4-Turbo, GPT-4, এবং Claude 3 Opus-এর সাথে আবদ্ধ, বিশ্বের দ্বিতীয় স্থানে রয়েছে;

হার্ড প্রম্পট তালিকায়, Yi-Large GPT-4-Turbo, GPT-4, এবং Claude 3 Opus-এর সাথে দ্বিতীয় স্থানে আছে।

উদ্দেশ্যমূলক ফলাফল পেতে বৈজ্ঞানিক পদ্ধতি ব্যবহার করুন

কিভাবে বৃহৎ মডেলের বস্তুনিষ্ঠ ও ন্যায্য মূল্যায়ন প্রদান করা যায় তা সর্বদাই শিল্পে ব্যাপক উদ্বেগের বিষয়।

পূর্বে, শিল্পে "র‍্যাঙ্কিং সোয়াইপ করার" বিভিন্ন পদ্ধতি ছিল, কিন্তু তারা সবসময়ই বড় মডেলের প্রকৃত ক্ষমতা প্রতিফলিত করতে অক্ষম হয়েছে, যারা কুয়াশার মধ্যে বুঝতে চায় এবং সংশ্লিষ্ট শিল্পে বিনিয়োগকারীরা তাদের মাথা ঘামাচ্ছে। .

LMSYS Org দ্বারা প্রকাশিত চ্যাটবট এরিনা এই বিশৃঙ্খলা ভাঙতে শুরু করে।

এর নভেল "এরেনা" ফরম্যাট এবং টেস্টিং টিমের কঠোরতার সাথে, এটি বৈশ্বিক শিল্প দ্বারা স্বীকৃত একটি মাপকাঠিতে পরিণত হয়েছে।

ওপেনএআই-এর প্রতিষ্ঠাতা দলের সদস্য আন্দ্রেজ কার্পাথি, এমনকি প্রকাশ্যে বলেছেন:

চ্যাটবট এরিনা দুর্দান্ত।

ফর্মের পরিপ্রেক্ষিতে, চ্যাটবট এরিনা সার্চ ইঞ্জিন যুগের অনুভূমিক তুলনামূলক মূল্যায়ন ধারণাগুলিকে আঁকে:

  • প্রথমত, মূল্যায়নের জন্য আপলোড করা সমস্ত "প্রবেশ" মডেলগুলি এলোমেলোভাবে জোড়ায় জোড়ায় জোড়ায় জোড়ায় এবং বেনামী মডেলের আকারে ব্যবহারকারীদের কাছে উপস্থাপন করা হয়;
  • তারপর প্রকৃত ব্যবহারকারীদের তাদের নিজস্ব প্রম্পট শব্দ লিখতে বলা হয় এবং প্রকৃত ব্যবহারকারীরা মডেলের নাম না জেনেই দুটি মডেলের পণ্যের উত্তর মূল্যায়ন করবে;
  • তারপরে অন্ধ পরীক্ষার প্ল্যাটফর্ম https://arena.lmsys.org/-এ, বড় মডেলগুলি জোড়ায় তুলনা করা হয়, এবং ব্যবহারকারী স্বাধীনভাবে বড় মডেল সম্পর্কে প্রশ্নগুলি ইনপুট করে;
  • মডেল A এবং মডেল B উভয় পক্ষের যথাক্রমে দুটি PK মডেলের প্রকৃত ফলাফল তৈরি করে ব্যবহারকারীরা চারটির মধ্যে একটি বেছে নিতে ফলাফলের নীচে ভোট দিতে পারেন: মডেল A ভাল/মডেল B ভাল/উভয়ই বাঁধা/উভয়ই ভাল নয়;
  • জমা দেওয়ার পরে, পিকে পরবর্তী রাউন্ড পরিচালনা করা যেতে পারে।

অনলাইন রিয়েল-টাইম ব্লাইন্ড টেস্টিং এবং বেনামী ভোটিং পরিচালনা করার জন্য প্রকৃত ব্যবহারকারীদের ক্রাউডফান্ডিং করার মাধ্যমে, চ্যাটবট এরিনা একদিকে পক্ষপাতের প্রভাব কমিয়ে দেয় এবং অন্যদিকে, সর্বোচ্চ সম্ভাব্য পরিমাণে পরীক্ষা সেটের উপর ভিত্তি করে র‌্যাঙ্কিংয়ের সম্ভাবনা এড়ায়, যার ফলে চূড়ান্ত ফলাফলের বস্তুনিষ্ঠতা বৃদ্ধি পায়।

চ্যাটবট এরিনা সমস্ত ব্যবহারকারীর ভোটিং ডেটা পরিষ্কার এবং বেনামী করার পরে সর্বজনীন করে তোলে।

প্রকৃত ব্যবহারকারী ভোটিং ডেটা সংগ্রহ করার পর, LMSYS চ্যাটবট এরিনা মডেলের কর্মক্ষমতা পরিমাপ করতে, স্কোরিং প্রক্রিয়াটিকে আরও অপ্টিমাইজ করতে এবং অংশগ্রহণকারীদের শক্তিকে মোটামুটিভাবে প্রতিফলিত করার জন্য ইলো স্কোরিং সিস্টেম ব্যবহার করবে।

ইলো স্কোরিং সিস্টেমে, প্রতিটি অংশগ্রহণকারী একটি বেসলাইন স্কোর পায় এবং প্রতিটি খেলার পরে, খেলার ফলাফলের উপর ভিত্তি করে অংশগ্রহণকারীর স্কোর সমন্বয় করা হয়।

সিস্টেমটি অংশগ্রহণকারীর রেটিং এর উপর ভিত্তি করে একটি কম স্কোরিং প্লেয়ার একটি উচ্চ স্কোরিং প্লেয়ারকে পরাজিত করার পরে, কম স্কোরিং প্লেয়ার আরও পয়েন্ট পাবে এবং এর বিপরীতে।

ইলো স্কোরিং সিস্টেম চালু করার মাধ্যমে, LMSYS চ্যাটবট এরিনা র‌্যাঙ্কিংয়ের বস্তুনিষ্ঠতা এবং ন্যায্যতা নিশ্চিত করে।

বড় জিততে ছোট ব্যবহার করুন

এইবার চ্যাটবট এরেনায় মোট 44টি মডেল অংশগ্রহণ করেছে, যার মধ্যে শীর্ষস্থানীয় ওপেন সোর্স মডেল Llama3-70B এবং প্রধান নির্মাতাদের ক্লোজড সোর্স মডেল রয়েছে।

  • সর্বশেষ Elo স্কোর বিচার করে, GPT-4o 1287 স্কোর নিয়ে তালিকার শীর্ষে রয়েছে;
  • GPT-4-Turbo, Gemini 1 5 Pro, Claude 3 0pus, Yi-Large এবং অন্যান্য মডেলগুলি প্রায় 1240 স্কোর সহ দ্বিতীয় স্তরে রয়েছে;
  • পরবর্তীকালে, বার্ড (জেমিনি প্রো), লামা-3-70বি-ইন্সট্রাক্ট এবং ক্লদ 3 সনেটের স্কোর একটি ক্লিফ থেকে প্রায় 1200 পয়েন্টে নেমে যায়।

উল্লেখ্য যে শীর্ষ 6 মডেলগুলি বিদেশী জায়ান্টগুলির অন্তর্গত যথাক্রমে জিরো-ওয়ান ওয়ানশেং বিশ্বে চতুর্থ স্থানে রয়েছে এবং জিপিটি-4 এবং জেমিনি 1.5 প্রো-এর মতো মডেলগুলি ট্রিলিয়ন-লেভেল প্যারামিটার রয়েছে৷ স্কেলের ফ্ল্যাগশিপ মডেল, এবং অন্যান্য মডেলগুলিও শত শত বিলিয়নের প্যারামিটার স্তরে রয়েছে।

Yi-লার্জ "বড় জিততে ছোট লাগে", শুধুমাত্র 100 বিলিয়ন প্যারামিটার লেভেলের সাথে ঘনিষ্ঠভাবে অনুসরণ করে।

AI বড় মডেলগুলির প্রতিযোগিতামূলক বিকাশ এখনও একটি মারাত্মক পর্যায়ে রয়েছে, এবং কৃত্রিম বুদ্ধিমত্তার "শত মডেলের যুদ্ধ" এই ক্ষেত্রে মঞ্চস্থ হতে থাকবে যেখানে "সপ্তাহ" বা এমনকি "দিন" পুনরাবৃত্তি ইউনিট হিসাবে ব্যবহৃত হয়, একটি অপেক্ষাকৃত ন্যায্য এবং বস্তুনিষ্ঠ মূল্যায়ন ব্যবস্থা বিশেষভাবে গুরুত্বপূর্ণ হয়ে ওঠে.

একটি মূল্যায়ন প্ল্যাটফর্ম যা ক্রমাগত স্কোরিং সিস্টেম আপডেট করে তা কেবল শিল্প বিনিয়োগকারীদের প্রযুক্তিগত উন্নয়নের প্রকৃত অবস্থা দেখতে দেয় না, তবে ব্যবহারকারীদের উন্নত মডেলগুলি বেছে নেওয়ার অধিকারও দেয় এবং সমগ্র বৃহৎ মডেল শিল্পের সুস্থ বিকাশকেও প্রচার করতে পারে। .

এটি তাদের নিজস্ব মডেল ক্ষমতার পুনরাবৃত্তির জন্য হোক বা দীর্ঘমেয়াদী খ্যাতির দৃষ্টিকোণ থেকে, বড় মডেল নির্মাতাদের প্রকৃত ব্যবহারকারীর প্রতিক্রিয়া এবং পেশাদার মূল্যায়ন প্রক্রিয়ার মাধ্যমে তাদের পণ্যগুলি প্রমাণ করার জন্য চ্যাটবট এরিনার মতো প্রামাণিক মূল্যায়ন প্ল্যাটফর্মে সক্রিয়ভাবে অংশগ্রহণ করা উচিত।

বিপরীতে, আপনি যদি শুধুমাত্র র‌্যাঙ্কিংয়ের ফলাফলের প্রতি যত্নবান হন এবং মডেলের বাস্তব প্রয়োগের প্রভাবকে উপেক্ষা করেন, তাহলে মডেলের ক্ষমতা এবং বাজারের চাহিদার মধ্যে ব্যবধান আরও স্পষ্ট হয়ে উঠবে এবং শেষ পর্যন্ত ভয়ঙ্কর AI-তে পা রাখা কঠিন হবে। বাজার প্রতিযোগিতা।

এআই যুগের তরঙ্গে, যদি বড় মডেল নির্মাতারা দুর্দান্ত বা এমনকি শীর্ষস্থানীয় হতে চান তবে তাদের কমপক্ষে দুটি গুণের প্রয়োজন:

  • আমাকে প্রতিদিন তিনবার নিজেকে পরীক্ষা করতে হবে: অগ্রগতির মাধ্যমে অভিজ্ঞতা অর্জন করতে হবে এবং প্রতিযোগিতার মাধ্যমে উত্তর পেতে হবে;
  • সত্যিকারের সোনা আগুনকে ভয় পায় না: "বন্য তালিকায়" প্রথম স্থান পাওয়ার পরিবর্তে, ভিতরের দিকে তাকানো এবং আপনার সত্যিকারের ক্ষমতা উন্নত করা ভাল।

অপেক্ষা করার মতো বিষয় হল এখন চমৎকার দেশীয় বৃহৎ-স্কেল মডেল নির্মাতাদের একটি গ্রুপ রয়েছে যারা ডাউন-টু-আর্থ, গবেষণা ও উন্নয়নে উদ্ভাবনী এবং এমনকি আন্তর্জাতিক মঞ্চে শিল্প জায়ান্টদের সাথে প্রতিযোগিতা করতে পারে।

LMSYS চ্যাটবট এরিনা ব্লাইন্ড টেস্ট এরিনা পাবলিক ভোটিং ঠিকানা: https://arena.lmsys.org/
LMSYS চ্যাটবট লিডারবোর্ড মূল্যায়ন র‌্যাঙ্কিং (রোলিং আপডেট): https://chat.lmsys.org/?leaderboard

# aifaner এর অফিসিয়াল WeChat পাবলিক অ্যাকাউন্ট অনুসরণ করতে স্বাগতম: aifaner (WeChat ID: ifanr) যত তাড়াতাড়ি সম্ভব আপনাকে আরও উত্তেজনাপূর্ণ সামগ্রী সরবরাহ করা হবে।

Ai Faner | মূল লিঙ্ক · মন্তব্য দেখুন · Sina Weibo