আজ সকালে, একটি 26 মিনিটের প্রেস কনফারেন্স আবারও এআই শিল্প এবং আমাদের ভবিষ্যত জীবনকে ব্যাপকভাবে পরিবর্তন করবে এবং অসংখ্য এআই স্টার্টআপকে দুর্বিষহ করে তুলবে।
এটি সত্যিই একটি শিরোনাম নয়, কারণ এটি একটি OpenAI প্রেস কনফারেন্স।
এইমাত্র, OpenAI আনুষ্ঠানিকভাবে GPT-4o প্রকাশ করেছে, যেখানে "o" এর অর্থ হল "omni" (যার অর্থ ব্যাপক এবং সর্বশক্তিমান) এই মডেলটিতে টেক্সট, ছবি, ভিডিও এবং ভয়েসের ক্ষমতা রয়েছে অসমাপ্ত সংস্করণ।
আরও কি, এই GPT-4 স্তরের মডেলটি সমস্ত ব্যবহারকারীদের জন্য বিনামূল্যে উপলব্ধ হবে এবং আগামী সপ্তাহগুলিতে ChatGPT প্লাসে রোল আউট করা হবে৷
আসুন আমরা প্রথমে এই সম্মেলনের হাইলাইটগুলিকে সংক্ষিপ্ত করি আরও কার্যকরী বিশ্লেষণের জন্য দয়া করে নীচে পড়ুন৷

সংবাদ সম্মেলনের মূল বিষয়গুলো
- নতুন GPT-4o মডেল: পাঠ্য, অডিও এবং চিত্রের যেকোনো ইনপুট খুলুন এবং মধ্যবর্তী রূপান্তর ছাড়াই সরাসরি একে অপরকে তৈরি করতে পারে
- GPT-4o ভয়েস লেটেন্সি উল্লেখযোগ্যভাবে হ্রাস করেছে এবং 232 মিলিসেকেন্ডে অডিও ইনপুটে সাড়া দিতে পারে, গড়ে 320 মিলিসেকেন্ড, যা কথোপকথনে মানুষের প্রতিক্রিয়া সময়ের মতো।
- GPT-4 বিনামূল্যে এবং সকল ব্যবহারকারীর জন্য উন্মুক্ত
- GPT-4o API, GPT4-টার্বো থেকে 2 গুণ দ্রুত এবং 50% সস্তা
- অত্যাশ্চর্য রিয়েল-টাইম ভয়েস সহকারী প্রদর্শন: কথোপকথনটি অনেকটা মানুষের মতো, রিয়েল টাইমে অনুবাদ করতে পারে, অভিব্যক্তি চিনতে পারে এবং ক্যামেরার মাধ্যমে স্ক্রীন চিনতে পারে, কোড লিখতে পারে এবং চার্ট বিশ্লেষণ করতে পারে
- ChatGPT নতুন UI, আরও সংক্ষিপ্ত
- MacOS-এর জন্য একটি নতুন ChatGPT ডেস্কটপ অ্যাপ, উইন্ডোজ সংস্করণ এই বছরের শেষের দিকে আসছে
এই বৈশিষ্ট্যগুলিকে অল্টম্যান ওয়ার্ম-আপ স্টেজের শুরুতে "জাদুর মতো অনুভূতি" হিসাবে বর্ণনা করেছিলেন। যেহেতু বিশ্বজুড়ে AI মডেলগুলি "GPT-4 এর সাথে ধরা পড়ছে", OpenAI এর অস্ত্রাগার থেকে কিছু বাস্তব জিনিস বের করতে হবে।
বিনামূল্যে এবং উপলব্ধ GPT-4o এখানে, কিন্তু এটি তার সবচেয়ে বড় হাইলাইট নয়
আসলে, প্রেস কনফারেন্সের আগের দিন, আমরা আবিষ্কার করেছি যে OpenAI নিঃশব্দে GPT-4 এর বর্ণনাকে "সবচেয়ে উন্নত মডেল" থেকে "উন্নত" এ পরিবর্তন করেছে।
এটি GPT-4o এর আগমনকে স্বাগত জানানোর জন্য। GPT-4o এর ক্ষমতা হল যে এটি পাঠ্য, অডিও এবং চিত্রের যেকোনো সমন্বয়কে ইনপুট হিসাবে গ্রহণ করতে পারে এবং সরাসরি উপরের মিডিয়া আউটপুট তৈরি করতে পারে।
এর মানে হল যে মানব-কম্পিউটার মিথস্ক্রিয়া মানুষের মধ্যে প্রাকৃতিক যোগাযোগের কাছাকাছি হবে।
GPT-4o 232 মিলিসেকেন্ডে অডিও ইনপুটে সাড়া দিতে পারে, গড়ে 320 মিলিসেকেন্ড, যা মানুষের কথোপকথনের প্রতিক্রিয়া সময়ের কাছাকাছি। পূর্বে ChatGPT-এর সাথে যোগাযোগ করার জন্য ভয়েস মোড ব্যবহার করে, গড় বিলম্বিতা ছিল 2.8 সেকেন্ড (GPT-3.5) এবং 5.4 সেকেন্ড (GPT-4)।
এটি ইংরেজি এবং কোড টেক্সটে GPT-4 Turbo-এর পারফরম্যান্সের সাথে মেলে, অ-ইংরেজি ভাষার টেক্সটে উল্লেখযোগ্য উন্নতি সহ, API-এ দ্রুত এবং 50% সস্তা।

বিদ্যমান মডেলগুলির সাথে তুলনা করে, GPT-4o ভিজ্যুয়াল এবং অডিও বোঝার ক্ষেত্রে বিশেষভাবে ভাল পারফর্ম করে।
- আপনি একটি কথোপকথন সময় যে কোনো সময় বাধা দিতে পারেন
- মানুষের মত মেজাজ এবং আবেগ সহ দৃশ্যের উপর ভিত্তি করে বিভিন্ন টোন তৈরি করতে পারে
- AI এর সাথে সরাসরি একটি ভিডিও কল করুন এবং এটি অনলাইনে বিভিন্ন প্রশ্নের উত্তর দিতে দিন
পরীক্ষার পরামিতিগুলি থেকে বিচার করে, GPT-4o-এর প্রধান ক্ষমতাগুলি মূলত GPT-4 Turbo-এর সমান স্তরে রয়েছে, যা বর্তমানে সবচেয়ে শক্তিশালী OpenAI।
[ছবি]
[ছবি]
[ছবি]
অতীতে, সিরি বা অন্যান্য ভয়েস সহকারীর সাথে আমাদের অভিজ্ঞতা আদর্শ ছিল না, ভয়েস সহকারীর সাথে কথোপকথন তিনটি পর্যায়ে গেছে:
- বক্তৃতা স্বীকৃতি বা "ASR": অডিও -> পাঠ্য, হুইস্পারের অনুরূপ;
- এলএলএম পরিকল্পনা করছে পরবর্তীতে কী বলব: পাঠ্য 1 -> পাঠ্য 2;
- সিনথেসিস-টু-স্পীচ বা "TTS": টেক্সট 2 -> অডিও, ভাবুন ElevenLabs বা VALL-E।

যাইহোক, আমাদের দৈনন্দিন স্বাভাবিক কথোপকথন মূলত এই মত
- আপনি যখন শুনবেন এবং কথা বলবেন তখন কী বলবেন তা নিয়ে ভাবুন;
- উপযুক্ত মুহুর্তে "হ্যাঁ, উম, উম" ঢোকান;
- অন্য পক্ষ কখন কথা বলা শেষ করবে এবং অবিলম্বে দায়িত্ব গ্রহণ করবে তা অনুমান করুন;
- স্বাভাবিকভাবে এবং বিরক্তি সৃষ্টি না করে অন্য ব্যক্তির কথোপকথনে বাধা দেওয়ার সিদ্ধান্ত নিন;
- আপনি যখন শুনবেন এবং কথা বলবেন তখন কী বলবেন তা নিয়ে ভাবুন;
- উপযুক্ত মুহুর্তে "হ্যাঁ, উম, উম" ঢোকান;
- সুন্দরভাবে হ্যান্ডেল এবং বাধা.
পূর্ববর্তী AI ভাষা সহকারীরা এই সমস্যাগুলি ভালভাবে পরিচালনা করতে পারেনি, এবং কথোপকথনের তিনটি পর্যায়ের প্রতিটিতে একটি বড় বিলম্ব হয়েছে, যার ফলে একটি দুর্বল অভিজ্ঞতা হয়েছে। একই সময়ে, প্রক্রিয়াটিতে প্রচুর তথ্য হারিয়ে যায়, যেমন সরাসরি স্বর, একাধিক স্পিকার, বা পটভূমির শব্দ পর্যবেক্ষণ করতে না পারা এবং হাসি, গান বা আবেগ প্রকাশ করতে অক্ষমতা।

যখন অডিও সরাসরি অডিও, ছবি, টেক্সট এবং ভিডিও তৈরি করতে পারে, তখন পুরো অভিজ্ঞতাই হবে লাফিয়ে লাফিয়ে।
GPT-4o হল একটি একেবারে নতুন মডেল যা এই উদ্দেশ্যে OpenAI দ্বারা প্রশিক্ষিত টেক্সট, ভিডিও এবং অডিও জুড়ে সরাসরি রূপান্তরের জন্য একই নিউরাল নেটওয়ার্ক দ্বারা সমস্ত ইনপুট এবং আউটপুট প্রক্রিয়া করা প্রয়োজন৷
আরও আশ্চর্যের বিষয় হল যে ChatGPT-এর বিনামূল্যে ব্যবহারকারীরা নিম্নলিখিত ফাংশনগুলি অনুভব করতে GPT-4o ব্যবহার করতে পারেন:
- GPT-4 স্তরের বুদ্ধিমত্তার অভিজ্ঞতা নিন
- মডেল এবং নেটওয়ার্ক থেকে প্রতিক্রিয়া পান
- ডেটা বিশ্লেষণ করুন এবং চার্ট তৈরি করুন
- আপনার তোলা ছবি সম্পর্কে কথা বলা যাক
- বিমূর্ত, লেখা বা বিশ্লেষণ সাহায্যের জন্য একটি ফাইল আপলোড করুন
- GPTs এবং GPT স্টোর ব্যবহার করা
- মেমরি দিয়ে আরও সহায়ক অভিজ্ঞতা তৈরি করুন
এবং আপনি যখন GPT-4o এর নিম্নলিখিত প্রদর্শনগুলি দেখেন, তখন আপনার অনুভূতি আরও জটিল হতে পারে।
ChatGPT সংস্করণ "জার্ভিস", সবার কাছেই আছে
চ্যাটজিপিটি শুধু কথা বলতে পারে না, শুনতেও পারে, এটি নতুন কিছু নয়, তবে চ্যাটজিপিটির "নতুন সংস্করণ" আমাকে অবাক করে।
ঘুমের সাথী
একটি নির্দিষ্ট জীবন দৃশ্যকে উদাহরণ হিসেবে নিলে, চ্যাটজিপিটি রোবট এবং প্রেম সম্পর্কে একটি শোবার সময় গল্প বলতে পারে এটি খুব বেশি চিন্তা না করেই একটি আবেগপূর্ণ এবং নাটকীয় শয়নকালের গল্প বলতে পারে।
এমনকি এটি গানের আকারে গল্পও বলতে পারে, যা ব্যবহারকারীদের ঘুমের সঙ্গী হিসেবে কাজ করতে পারে।
প্রশ্ন মাস্টার

অথবা, প্রেস কনফারেন্সে, রৈখিক সমীকরণ 3X+1=4 কীভাবে সমাধান করতে সাহায্য করা যায় তা প্রদর্শন করুন এটি আপনাকে ধাপে ধাপে গাইড করতে পারে এবং সঠিক উত্তর দিতে পারে।
অবশ্যই, উপরেরটি এখনও কিছুটা "শিশুর খেলা" এবং সাইটে কোডিং অসুবিধাগুলিই আসল পরীক্ষা। যাইহোক, এটি সহজেই তিনটি স্ট্রাইক, পাঁচটি স্ট্রাইক এবং দুটি স্ট্রাইক দিয়ে সমাধান করা যেতে পারে।

ChatGPT-এর "ভিশন" দিয়ে, এটি কম্পিউটার স্ক্রিনে সবকিছু দেখতে পারে, যেমন কোড বেসের সাথে ইন্টারঅ্যাক্ট করা এবং কোড দ্বারা তৈরি চার্ট দেখা, কিছু ভুল হয়েছে? তাহলে কি ভবিষ্যতে আমাদের গোপনীয়তা পরিষ্কারভাবে দেখা যাবে না?

রিয়েল-টাইম অনুবাদ
ঘটনাস্থলে উপস্থিত দর্শকরা চ্যাটজিপিটি-কে কিছু জটিল প্রশ্নও করেছিল।
ইংরেজি থেকে ইতালীয় এবং ইতালীয় থেকে ইংরেজিতে অনুবাদ করা, আপনি এই AI ভয়েস সহকারী যতই ব্যবহার করুন না কেন, এটি সহজেই করতে পারে যে একটি অনুবাদক কিনতে অনেক টাকা খরচ করার প্রয়োজন নেই ভবিষ্যতে, সম্ভবত ChatGPT আপনার রিয়েল-টাইমের চেয়ে ভাল হতে পারে অনুবাদকটি বেশ নির্ভরযোগ্য।
এই মুহূর্তে Feishu নথির বাইরে এই বিষয়বস্তু প্রদর্শন করা যাবে না।
▲ রিয়েল-টাইম অনুবাদ (অফিসিয়াল ওয়েবসাইটের ক্ষেত্রে)
ভাষার আবেগ উপলব্ধি করা শুধুমাত্র প্রথম ধাপ হল ChatGPT মানুষের মুখের আবেগকেও ব্যাখ্যা করতে পারে।

প্রেস কনফারেন্সে, চ্যাটজিপিটি সরাসরি একটি টেবিলের জন্য ক্যামেরা দ্বারা বন্দী মুখটিকে ভুল করেছিল ঠিক যখন সবাই ভেবেছিল যে এটি ঘুরতে চলেছে, তখন এটি পরিণত হয়েছিল কারণ সামনের দিকের ক্যামেরাটি টেবিলের দিকে লক্ষ্য ছিল। .
যাইহোক, শেষ পর্যন্ত, এটি সেলফিতে মুখের আবেগগুলি সঠিকভাবে বর্ণনা করেছে এবং মুখের "উজ্জ্বল" হাসিকে সঠিকভাবে চিহ্নিত করেছে।
মজার বিষয় হল, প্রেস কনফারেন্সের শেষে, মুখপাত্র এনভিডিয়া এবং এর প্রতিষ্ঠাতা লাও হুয়াং থেকে কিউ এর "দৃঢ় সমর্থন" ভুলে যাননি তিনি সত্যিই মানব প্রকৃতির বোধগম্য।
একটি কথোপকথন ভাষার ইন্টারফেসের ধারণাটি অবিশ্বাস্যভাবে ভবিষ্যদ্বাণীমূলক ছিল।
অল্টম্যান পূর্ববর্তী সাক্ষাত্কারগুলিতে ব্যক্ত করেছিলেন যে তিনি শেষ পর্যন্ত এআই মুভি "হার" এর মতো একটি এআই সহকারী বিকাশ করার আশা করছেন এবং ওপেনএআই দ্বারা প্রকাশিত ভয়েস সহকারী আজ বাস্তবে আসছে।

ওপেনএআই-এর চিফ অপারেটিং অফিসার ব্র্যাড লাইটক্যাপ খুব বেশি দিন আগে ভবিষ্যদ্বাণী করেছিলেন যে ভবিষ্যতে আমরা এআই চ্যাটবটগুলির সাথে কথা বলব যেভাবে আমরা মানুষের সাথে কথা বলি, তাদের সাথে একটি দলের অংশ হিসাবে আচরণ করি।
এখন মনে হচ্ছে এটি শুধুমাত্র আজকের সম্মেলনের জন্য পথ প্রশস্ত করেনি, পরবর্তী দশ বছরে আমাদের জীবনে একটি প্রাণবন্ত পাদটীকাও বয়ে আনবে।
অ্যাপল তেরো বছর ধরে এআই ভয়েস সহকারীর সাথে লড়াই করছে এবং গোলকধাঁধা থেকে বেরিয়ে আসতে পারেনি, কিন্তু ওপেনএআই রাতারাতি প্রস্থান খুঁজে পেয়েছে। এটা অদূর ভবিষ্যতে, আয়রন ম্যান এর "জার্ভিস" আর একটি ফ্যান্টাসি হবে না.
"সে আসছে
যদিও স্যাম অল্টম্যান সম্মেলনে উপস্থিত হননি, তিনি সম্মেলনের পরে একটি ব্লগ প্রকাশ করেছেন এবং X: her-এ একটি শব্দ পোস্ট করেছেন।
এটি স্পষ্টতই একই নামের ক্লাসিক সায়েন্স ফিকশন মুভি "হার" এর একটি ইঙ্গিত ছিল যখন আমি এই সম্মেলনের উপস্থাপনা দেখেছিলাম।
"তার" মুভিতে সামান্থা শুধুমাত্র একটি পণ্য নয়, তিনি এমনকি মানুষের চেয়ে মানুষকে আরও ভাল বোঝেন এবং তার সাথে যোগাযোগ করার সময় আপনি সত্যিই ধীরে ধীরে ভুলে যেতে পারেন যে তিনি একজন এআই৷

এর মানে হল যে মানব-কম্পিউটার মিথস্ক্রিয়া মডেল গ্রাফিকাল ইন্টারফেসের পরে সত্যিকারের বিপ্লবী আপডেটের সূচনা করতে পারে, যেমন স্যাম অল্টম্যান তার ব্লগে বলেছেন:
নতুন ভয়েস (এবং ভিডিও) মোডগুলি আমার ব্যবহার করা সেরা কম্পিউটার ইন্টারফেস। এটি একটি চলচ্চিত্র থেকে একটি AI মত মনে হয় এবং আমি এখনও এটি বাস্তব একটি সামান্য বিস্মিত. মানব-স্তরের প্রতিক্রিয়ার সময় এবং অভিব্যক্তিতে পৌঁছানো একটি বড় পরিবর্তন হতে দেখা যায়।
পূর্ববর্তী চ্যাটজিপিটি আমাদের স্বাভাবিক ইউজার ইন্টারফেসের শুরু দেখতে দেয়: অন্য সব কিছুর উপরে সরলতা: জটিলতা প্রাকৃতিক ইউজার ইন্টারফেসের শত্রু। প্রতিটি মিথস্ক্রিয়া স্ব-ব্যাখ্যামূলক হওয়া উচিত, কোন নির্দেশ ম্যানুয়াল প্রয়োজন নেই।
কিন্তু আজ প্রকাশিত GPT-4o এর প্রতিক্রিয়ায় প্রায় কোনো বিলম্ব নেই, এটি স্মার্ট, আকর্ষণীয় এবং ব্যবহারিকভাবে এমন স্বাভাবিক এবং মসৃণ মিথস্ক্রিয়া কখনোই অনুভব করেনি।
এখানে এখনও বিশাল সম্ভাবনা লুকিয়ে আছে যখন আরও ব্যক্তিগতকৃত ফাংশন এবং বিভিন্ন টার্মিনাল ডিভাইসের সাথে সহযোগিতা করা হয়, এর মানে হল যে আমরা মোবাইল ফোন, কম্পিউটার, স্মার্ট গ্লাস এবং অন্যান্য কম্পিউটিং টার্মিনাল ব্যবহার করতে পারি যা আগে সম্ভব ছিল না৷
AI হার্ডওয়্যার আর জমা করার চেষ্টা করবে না এখন যেটা বেশি উত্তেজনাপূর্ণ তা হল অ্যাপল যদি আগামী মাসে WWDC-তে ওপেনএআই-এর সাথে তার সহযোগিতার ঘোষণা দেয়, তাহলে সাম্প্রতিক বছরগুলিতে যে কোনও সম্মেলনের তুলনায় আইফোনের অভিজ্ঞতা আরও উন্নত হতে পারে।
NVIDIA সিনিয়র কোড বিজ্ঞানী জিম ফ্যান বিশ্বাস করেন যে iOS 18, ইতিহাসের বৃহত্তম আপডেট হিসাবে পরিচিত, এবং OpenAI-এর মধ্যে সহযোগিতার তিনটি স্তর থাকতে পারে:
- Siri ত্যাগ করে, OpenAI iOS-এর জন্য একটি ছোট GPT-4o পরিমার্জন করেছে যা ক্লাউড পরিষেবাগুলি ব্যবহার করার জন্য আপগ্রেড করার জন্য অর্থপ্রদানের বিকল্প সহ সম্পূর্ণরূপে ডিভাইসে চলে।
- নেটিভ কার্যকারিতা মডেলের মধ্যে ক্যামেরা বা স্ক্রীন স্ট্রীম ফিড করে। নিউরাল অডিও এবং ভিডিও কোডেকগুলির জন্য চিপ-স্তরের সমর্থন।
- iOS সিস্টেম-লেভেল অপারেশন API এবং স্মার্ট হোম API এর সাথে একীভূত করুন। কেউ সিরি শর্টকাট ব্যবহার করে না, তবে এটি একটি পুনরুজ্জীবনের সময়। এটি গেটের বাইরে এক বিলিয়ন ব্যবহারকারীর সাথে একটি AI এজেন্ট পণ্য হয়ে উঠতে পারে। এটি স্মার্টফোনের জন্য টেসলার মতো পূর্ণ আকারের ডেটা ফ্লাইহুইলের মতো।
যা বলতে গেলে, গুগলের জন্য আমাকে দুঃখিত হতে হবে, যা আগামীকাল একটি সংবাদ সম্মেলন করবে।
লেখক: লি চাওফান এবং মো চংইউ
# aifaner এর অফিসিয়াল WeChat পাবলিক অ্যাকাউন্ট অনুসরণ করতে স্বাগতম: aifaner (WeChat ID: ifanr) যত তাড়াতাড়ি সম্ভব আপনাকে আরও উত্তেজনাপূর্ণ সামগ্রী সরবরাহ করা হবে।
