
কয়েক মাস আগে, iFanr সফলভাবে একটি M3 আল্ট্রা প্রসেসর সহ একটি ম্যাক স্টুডিওতে একটি 671B DeepSeek স্থানীয় বড় মডেল (4-বিট কোয়ান্টাইজড সংস্করণ) স্থাপন করেছে । M3 আল্ট্রা প্রসেসর সহ চারটি টপ-অফ-দ্য-লাইন ম্যাক স্টুডিও যদি "ডেস্কটপ-লেভেল এআই ক্লাস্টার" গঠনের জন্য ওপেন সোর্স টুল ব্যবহার করে একসাথে সংযুক্ত করা হয়, তাহলে কি স্থানীয় অনুমানের সিলিং আরও বেশি বাড়ানো যেতে পারে?
এটিও সেই সমস্যা যা এক্সো ল্যাবস, একটি ব্রিটিশ স্টার্টআপ, সমাধান করার চেষ্টা করছে।
ধরে নিবেন না যে অক্সফোর্ড ইউনিভার্সিটিতে সীমাহীন GPU সরবরাহ রয়েছে
আপনি ভাবতে পারেন যে অক্সফোর্ডের মতো একটি শীর্ষ বিশ্ববিদ্যালয়ে এটি ব্যবহার করার চেয়ে বেশি জিপিইউ থাকতে পারে, তবে এটি মোটেও তা নয়।
এক্সো ল্যাবসের প্রতিষ্ঠাতা অ্যালেক্স এবং সেথ অক্সফোর্ড বিশ্ববিদ্যালয় থেকে স্নাতক হয়েছেন। এমনকি এই ধরনের একটি মর্যাদাপূর্ণ প্রতিষ্ঠানে, GPU ক্লাস্টারগুলিতে অ্যাক্সেসের জন্য কয়েক মাস লাইনে অপেক্ষা করতে হবে এবং অ্যাপ্লিকেশনগুলিকে একবারে একটি কার্ড তৈরি করা যেতে পারে যা প্রক্রিয়াটিকে দীর্ঘ এবং অদক্ষ করে তোলে।
তারা বুঝতে পারে যে বর্তমান উচ্চ কেন্দ্রীভূত AI পরিকাঠামো পৃথক গবেষক এবং ছোট দলকে প্রান্তিক করে তোলে।
গত জুলাইয়ে, তারা তাদের প্রথম পরীক্ষা শুরু করেছে, সফলভাবে দুটি MacBook Pros ব্যবহার করে LLaMA মডেল চালাচ্ছে। যদিও কর্মক্ষমতা সীমিত ছিল, প্রতি সেকেন্ডে মাত্র তিনটি টোকেন আউটপুট করা, এটি বিতরণকৃত AI যুক্তির জন্য অ্যাপল সিলিকন আর্কিটেকচার ব্যবহারের সম্ভাব্যতা প্রদর্শনের জন্য যথেষ্ট ছিল।

এম 3 আল্ট্রা ম্যাক স্টুডিও প্রকাশের সাথে সাথে টার্নিং পয়েন্ট এসেছিল। এর 512GB ইউনিফাইড মেমরি, 819GB/s মেমরি ব্যান্ডউইথ, একটি 80-কোর GPU এবং Thunderbolt 5-এর 80Gbps দ্বিমুখী স্থানান্তর ক্ষমতা স্থানীয় AI ক্লাস্টারকে বাস্তবে পরিণত করেছে।
একই সময়ে দুটি 67 বিলিয়ন প্যারামিটার মডেল চালানোর মত কি?
থান্ডারবোল্ট 5 এর মাধ্যমে M3 আল্ট্রা প্রসেসরের সাথে চারটি টপ-অফ-দ্য-লাইন ম্যাক স্টুডিও সংযুক্ত করার পরে, পারফরম্যান্সের পরিসংখ্যানগুলি বেশ চিত্তাকর্ষক:
- 128-কোর CPU (32×4)
- 240 GPU কোর (80×4)
- 2TB ইউনিফাইড মেমরি (512GB x 4)
- মোট মেমরি ব্যান্ডউইথ 3TB/s ছাড়িয়ে গেছে
এই সংমিশ্রণটি প্রায় একটি ছোট, হোম-গ্রেড সুপার কম্পিউটারের সমতুল্য। যাইহোক, হার্ডওয়্যার শুধুমাত্র ভিত্তি; সত্যিকার অর্থে এর শক্তি উন্মোচনের চাবিকাঠি Exo V2 এর মধ্যে রয়েছে, এক্সো ল্যাবস দ্বারা তৈরি বিতরণকৃত মডেল শিডিউলিং প্ল্যাটফর্ম। Exo V2 মেমরি এবং ব্যান্ডউইথ উপলব্ধতার উপর ভিত্তি করে মডেলটিকে স্বয়ংক্রিয়ভাবে বিভক্ত করে, এটি সবচেয়ে উপযুক্ত নোডে স্থাপন করে।
সাইটে, Exo V2 নিম্নলিখিত মূল ক্ষমতাগুলি প্রদর্শন করেছে:
- বড় মডেলগুলি লোড করা হচ্ছে: 8-বিট কোয়ান্টাইজেশন সহ একটি সম্পূর্ণ ডিপসিক মডেলের জন্য 700GB এর বেশি মেমরির প্রয়োজন, যা একটি একক ম্যাক স্টুডিওর ক্ষমতার চেয়ে অনেক বেশি। Exo লোডিং প্রক্রিয়া সম্পূর্ণ করতে মডেলটিকে দুটি ম্যাক স্টুডিওতে বিভক্ত করে। একবার সক্রিয় হয়ে গেলে, এর "টাইপিং গতি" মানুষের পড়ার গতিকে ছাড়িয়ে যায়।

- সমান্তরাল অনুমান: DeepSeek R1, এছাড়াও 67 বিলিয়ন প্যারামিটার সহ, DeepSeek V3 এ লোড করা হয়েছিল। সিস্টেমটি অবিলম্বে অবশিষ্ট দুটি ডিভাইসে R1 বিতরণ করে, দুটি বড় মডেলের সমান্তরাল অনুমান সক্ষম করে এবং একাধিক ব্যবহারকারীদের দ্বারা একযোগে প্রশ্ন করা সমর্থন করে।

- ব্যক্তিগত নথি প্রশ্নোত্তর : একটি কোম্পানির আর্থিক প্রতিবেদন PDF এ টেনে আনুন, এবং মডেলটি স্থানীয়ভাবে জ্ঞান এম্বেডিং এবং প্রশ্নোত্তর সম্পূর্ণ করবে। এটি কোনও ক্লাউড সংস্থানগুলির উপর নির্ভর করে না এবং ডেটা সম্পূর্ণ ব্যক্তিগত এবং নিয়ন্ত্রণযোগ্য।

- লাইটওয়েট ফাইন-টিউনিং: হাজার হাজার অভ্যন্তরীণ নথি সহ এন্টারপ্রাইজগুলি QLoRA + LoRA প্রযুক্তি ব্যবহার করে স্থানীয় ফাইন-টিউনিং করতে পারে। একটি একক মেশিনকে ফাইন-টিউনিং করতে অনেক দিন সময় লাগতে পারে, কিন্তু Exo-এর ক্লাস্টার শিডিউলিং ক্ষমতার সাথে, প্রশিক্ষণের কাজগুলিকে রৈখিকভাবে ত্বরান্বিত করা যেতে পারে, উল্লেখযোগ্যভাবে সময় খরচ কমিয়ে দেয়।
বিশাল খরচের পার্থক্য
iFanr ব্যাকস্টেজে টপোলজি ডায়াগ্রামটি পর্যবেক্ষণ করেছে এবং দেখেছে যে চারটি মেশিন একই সময়ে উচ্চ-লোড অবস্থায় থাকলেও, পুরো সিস্টেমের শক্তি খরচ সর্বদা 400W এর মধ্যে নিয়ন্ত্রিত হয় এবং অপারেশন চলাকালীন প্রায় কোনও ফ্যানের শব্দ ছিল না।
প্রথাগত সার্ভার সমাধানে একই কর্মক্ষমতা অর্জন করতে, কমপক্ষে 20টি A100 গ্রাফিক্স কার্ড স্থাপন করতে হবে। সার্ভার এবং নেটওয়ার্ক সরঞ্জামের খরচ 2 মিলিয়ন RMB ছাড়িয়ে গেছে, বিদ্যুৎ খরচ কয়েক কিলোওয়াটে পৌঁছেছে এবং একটি স্বাধীন কম্পিউটার রুম এবং কুলিং সিস্টেম প্রয়োজন।
অ্যাপল চিপগুলি অপ্রত্যাশিতভাবে এআই তরঙ্গে একটি নতুন অবস্থান খুঁজে পেয়েছে

M3 আল্ট্রা ম্যাক স্টুডিও 32,999 ইউয়ান থেকে শুরু হয় এবং 96GB ইউনিফাইড মেমরির সাথে আসে, যেখানে টপ-অফ-দ্য-লাইন 512GB সংস্করণটি সত্যিই ব্যয়বহুল। যাইহোক, একটি প্রযুক্তিগত দৃষ্টিকোণ থেকে, ইউনিফাইড মেমরি আর্কিটেকচার দ্বারা আনা সুবিধাগুলি বৈপ্লবিক।
অ্যাপল যখন প্রথম এম চিপ ডিজাইন করেছিল, তখন এটি প্রাথমিকভাবে শক্তি-দক্ষ এবং দক্ষ ব্যক্তিগত সৃষ্টির উদ্দেশ্যে ছিল। যাইহোক, ইউনিফাইড মেমরি, একটি উচ্চ-ব্যান্ডউইথ জিপিইউ এবং থান্ডারবোল্ট মাল্টিপাথ অ্যাগ্রিগেশনের মতো বৈশিষ্ট্যগুলি এআই যুগে অপ্রত্যাশিতভাবে একটি নতুন কুলুঙ্গি খুঁজে পেয়েছে।
প্রথাগত GPU, এমনকি সর্বোচ্চ-শেষের ওয়ার্কস্টেশন কার্ডগুলিতে সাধারণত মাত্র 96GB ভিডিও মেমরি থাকে। অ্যাপলের ইউনিফাইড মেমরি সিপিইউ এবং জিপিইউকে একই উচ্চ-ব্যান্ডউইথ মেমরি শেয়ার করতে দেয়, বিভিন্ন স্টোরেজ স্তরের মধ্যে ঘন ঘন ডেটা স্থানান্তরের প্রয়োজনীয়তা দূর করে। এটি বড় আকারের মডেল অনুমানের জন্য অত্যন্ত গুরুত্বপূর্ণ।
অবশ্যই, EXO সমাধানেরও একটি স্বতন্ত্র অবস্থান রয়েছে। এটি H100-এর সাথে প্রতিযোগিতা করার জন্য ডিজাইন করা হয়নি, বা এটি GPT-এর পরবর্তী প্রজন্মকে প্রশিক্ষণ দেওয়ার জন্য ডিজাইন করা হয়নি। পরিবর্তে, এটি ব্যবহারিক অ্যাপ্লিকেশন সমস্যাগুলি সমাধান করার জন্য ডিজাইন করা হয়েছে: আপনার নিজস্ব মডেলগুলি চালানো, আপনার নিজস্ব ডেটা রক্ষা করা এবং প্রয়োজনীয় সূক্ষ্ম-টিউনিং এবং অপ্টিমাইজেশান সম্পাদন করা।
যদি H100 পিরামিডের শীর্ষে রাজা হয়, তাহলে ম্যাক স্টুডিও ছোট এবং মাঝারি আকারের দলের হাতে সুইস আর্মি ছুরি হয়ে উঠছে।
#iFaner-এর অফিসিয়াল WeChat পাবলিক অ্যাকাউন্ট অনুসরণ করতে স্বাগতম: iFaner (WeChat ID: ifanr), যেখানে যত তাড়াতাড়ি সম্ভব আপনার কাছে আরও উত্তেজনাপূর্ণ সামগ্রী উপস্থাপন করা হবে।
