এআই ক্ষেত্রের পাঁচ শীর্ষ ব্যক্তিত্ব ইয়াং ঝিলিন, লুও ফুলি, জিয়া লিক্সুয়ে, ঝাং পেং এবং হুয়াং চাও লবস্টার, টোকেন এবং ওপেন সোর্স নিয়ে বিশদ আলোচনা করেছেন।

সাম্প্রতিককালে এআই কমিউনিটিতে সবচেয়ে বেশি ব্যবহৃত শব্দগুলোর মধ্যে লবস্টার অন্যতম।

এটি ওপেনক্ল (OpenClaw)-কে নির্দেশ করে, যা একটি ওপেন-সোর্স ইন্টেলিজেন্ট এজেন্ট ফ্রেমওয়ার্ক এবং সম্প্রতি এআই কমিউনিটিতে দ্রুত ছড়িয়ে পড়েছে। কেউ কেউ এটিকে জার্ভিস (Jarvis)-এর মতো, কেউ স্ক্যাফোল্ডিং (scaffolding)-এর মতো, আবার কেউ কেউ এটিকে একটি লাইটওয়েট অপারেটিং সিস্টেমের মতো মনে করেন। সবাই এটি ব্যবহার করছে এবং যত বেশি ব্যবহার করছে, ততই এর ব্যবহার থামানো যাচ্ছে না।

এটিকে ঘিরে নানা আলোচনা শুরু হয়েছে: লবস্টার কী করতে পারে, কী পারে না, এরপর এর গন্তব্য কোথায়, কম্পিউটিং শক্তি কি যথেষ্ট, কারা লাভবান হচ্ছে এবং কারা উদ্বিগ্ন।

এখন, এই শিল্পের একেবারে সামনের সারির একদল মানুষ বসে এ বিষয়ে একটি গুরুতর আলোচনা করেছেন। এইমাত্র, বেইজিং-এ অনুষ্ঠিত ঝংগুয়ানচুন ফোরামের বার্ষিক সভায় মুন'স ডার্ক সাইড-এর প্রতিষ্ঠাতা ইয়াং ঝিলিন ওপেন-সোর্স বিষয়ক একটি গোলটেবিল বৈঠক সঞ্চালনা করেন। অংশগ্রহণকারীদের মধ্যে ছিলেন ঝিপু-এর প্রতিষ্ঠাতা ঝাং পেং; উওয়েনশিনচিওং-এর প্রতিষ্ঠাতা জিয়া লিশুয়ে; শাওমি মিমি লার্জ মডেলের প্রধান লুও ফুলি; এবং হংকং বিশ্ববিদ্যালয়ের সহকারী অধ্যাপক হুয়াং চাও।

আলোচনাটি ওপেনক্ল-এর প্রকৃত ব্যবহারকারীর অভিজ্ঞতা দিয়ে শুরু হয়েছিল এবং মডেল মূল্য নির্ধারণের যুক্তি, ইনফারেন্স পরিকাঠামোর কাঠামোগত প্রতিবন্ধকতা, মডেল স্থাপত্যের উদ্ভাবন এবং আগামী বারো মাসে শিল্পের প্রবণতা সম্পর্কে সম্মিলিত মতামত পর্যন্ত বিস্তৃত হয়েছিল।

আড্ডা দেওয়া থেকে শুরু করে কাজ করা পর্যন্ত, ওপেনক্ল কী কী পরিবর্তন এনেছে?

ফোরামের শুরুতে ইয়াং ঝিলিন একটি সাধারণ বিষয় উত্থাপন করেন: দৈনন্দিন জীবনে ওপেনক্ল বা অনুরূপ পণ্য ব্যবহার করার সময় সবচেয়ে কল্পনাপ্রবণ অভিজ্ঞতা কোনটি? প্রযুক্তিগত দৃষ্টিকোণ থেকে, আজকের ইন্টেলিজেন্ট এজেন্ট ফ্রেমওয়ার্কগুলোর বিবর্তনকে আমাদের কীভাবে বোঝা উচিত?

ঝাং পেং বলেন, তিনি অনেক আগে থেকেই এই ধরনের টুল নিয়ে কাজ করা শুরু করেছিলেন, যখন এর নাম ওপেনক্ল (OpenClaw) ছিল না, বরং ছিল ক্লবট (ClawBot)। পেশায় একজন প্রোগ্রামার হওয়ায় এই বিষয়গুলোতে তাঁর সহজাত দক্ষতা রয়েছে। তাঁর মতে, ওপেনক্ল-এর সবচেয়ে বড় সাফল্য হলো শীর্ষস্থানীয় মডেলগুলোর সক্ষমতা, বিশেষ করে প্রোগ্রামিং এবং ইন্টেলিজেন্ট এজেন্টের ক্ষেত্রে, সাধারণ মানুষের কাছে সহজলভ্য করে তোলা।

এটি এখন আর শুধু প্রোগ্রামার বা গিকদের একচেটিয়া ক্ষেত্র নয়। এটি মডেলটির উপর একটি মজবুত অথচ নমনীয় কাঠামো তৈরি করেছে, যার ফলে কোডিং দক্ষতার অভাবে পূর্বে অসম্ভব এমন ধারণাগুলোও আজ সাধারণ আলোচনার মাধ্যমে সম্পন্ন করা সম্ভব হচ্ছে। তিনি ওপেনক্ল-এর মতো টুলগুলোকে স্ক্যাফোল্ডিং বলতে বেশি পছন্দ করেন, কারণ এগুলো কোনো বদ্ধ পণ্যের পরিবর্তে একটি সম্ভাবনার দ্বার উন্মোচন করে।

জিয়া লিক্সুয়ের প্রথম প্রতিক্রিয়া ছিল অস্বস্তিকর। তিনি বড় বড় মডেলের সাথে যোগাযোগ করতে অভ্যস্ত ছিলেন এবং শুরুতে ওপেনক্লকে ধীর ও ল্যাগি বলে মনে হয়েছিল। কিন্তু পরে তিনি বুঝতে পারেন যে এই ধরনের টুল একটি চ্যাটবট থেকে মৌলিকভাবে ভিন্ন: এটি প্রশ্নোত্তরের একটি টুলের চেয়ে বরং বড় কাজ সামলাতে সক্ষম একজন মানুষের মতো।

টোকেন-ভিত্তিক বিলিং মডেল থেকে শুরু করে কাজ সম্পন্ন করতে সাহায্যকারী ইন্টেলিজেন্ট এজেন্ট পর্যন্ত, এআই-এর সম্ভাবনা এক বিশাল উল্লম্ফন ঘটিয়েছে। কিন্তু একই সাথে, পুরো সিস্টেমের সক্ষমতার উপর চাহিদাও উল্লেখযোগ্যভাবে বৃদ্ধি পেয়েছে, যে কারণে আমার প্রথমে মনে হয়েছিল এটি ধীরগতির।

এরপর তিনি একটি চমকপ্রদ পরিসংখ্যান প্রকাশ করেন: এই বছরের জানুয়ারির শেষ থেকে উওয়েনশিনচিওং-এর টোকেন ব্যবহার মূলত প্রতি দুই সপ্তাহে দ্বিগুণ হয়েছে এবং এখন তা দশগুণ বৃদ্ধি পেয়েছে। "শেষবার আমি এই বৃদ্ধির হার দেখেছিলাম ৩জি যুগে, যখন মোবাইল ডেটা সবেমাত্র ব্যাপকভাবে প্রচলিত হচ্ছিল। তখন প্রত্যেকের কাছে প্রতি মাসে ১০০ মেগাবাইট ডেটা থাকত, এবং বর্তমান টোকেন ব্যবহার সেই অনুভূতিই দেয়।"

তিনি মনে করেন যে, এই দ্রুত বর্ধনশীল যুগকে সমর্থন করার জন্য বিদ্যমান সমস্ত সম্পদ প্রয়োজনের তুলনায় অপ্রতুল, এবং আরও ভালো সমন্বয় ও একীকরণ প্রয়োজন।

লুও ফুলি প্রোডাক্ট ফ্রেমওয়ার্ক ডিজাইনের দৃষ্টিকোণ থেকে একটি ভিন্ন দৃষ্টিভঙ্গি তুলে ধরেছেন। তিনি এজেন্ট ফ্রেমওয়ার্ক ক্ষেত্রে ওপেনক্লকে একটি বৈপ্লবিক এবং যুগান্তকারী ঘটনা হিসেবে দেখেন। তিনি উল্লেখ করেছেন যে ডিপ কোডিং কমিউনিটির অনেকেই এখনও ক্লড কোডকে তাদের প্রথম পছন্দ হিসেবে বেছে নেন, কিন্তু তিনি বিশ্বাস করেন যে শুধুমাত্র তারাই এর অনন্য ডিজাইন বৈশিষ্ট্যগুলোর মর্ম উপলব্ধি করতে পারবেন, যারা সত্যিকার অর্থে ওপেনক্ল ব্যবহার করেছেন। তিনি আরও উল্লেখ করেন যে ক্লড কোডের সাম্প্রতিক অনেক আপডেট আসলে ওপেনক্লের ডিজাইন ধারার দিকেই এগিয়ে যাচ্ছে।

তিনি ওপেনক্ল-এর মূল মূল্যবোধের দুটি স্তরের সারসংক্ষেপ তুলে ধরেন।

প্রথমটি হলো ওপেন সোর্স। ওপেন সোর্স গভীর কমিউনিটি অংশগ্রহণ এবং ক্রমাগত উন্নতির সুযোগ করে দেয়, যা একটি অত্যন্ত গুরুত্বপূর্ণ পূর্বশর্ত। তিনি বিশ্বাস করেন যে, ওপেন সোর্স ফ্রেমওয়ার্কের একটি প্রধান সুবিধা হলো এটি দেশীয় মডেলগুলোর সক্ষমতার সর্বোচ্চ সীমা উল্লেখযোগ্যভাবে বাড়িয়ে দেয়; এই মডেলগুলোতে খুব বেশি প্যারামিটার না থাকলেও, এগুলোর মধ্যে যথেষ্ট দক্ষতা বিদ্যমান।

বেশিরভাগ ক্ষেত্রে, কাজ সম্পন্ন করার হার ক্লডের সর্বশেষ মডেলের স্তরের খুব কাছাকাছি থাকে, পাশাপাশি একটি সম্পূর্ণ হারনেস সিস্টেম এবং স্কিলস সিস্টেমের কল্যাণে এটি একটি ভালো নিম্ন সীমাও বজায় রাখে।

দ্বিতীয়ত, এটি বৃহৎ মডেলের উপরের স্তর, অর্থাৎ ইন্টেলিজেন্ট এজেন্ট স্তর সম্পর্কে সকলের কল্পনাকে উদ্দীপ্ত করেছিল। তিনি দেখলেন যে, গবেষণার পটভূমি ছাড়াই আরও বেশি সংখ্যক মানুষ শক্তিশালী এজেন্ট ফ্রেমওয়ার্কের মাধ্যমে এজিআই-এর রূপান্তরে অংশগ্রহণ করতে শুরু করেছে, যা অনেকাংশে তাদের কাজের পুনরাবৃত্তিমূলক কাজগুলো প্রতিস্থাপন করছে এবং আরও সৃজনশীল কাজ করার জন্য সময় বের করে দিচ্ছে।

তিনি একটি বিশেষ ব্যবহারকারী অভিজ্ঞতার কথাও উল্লেখ করেছেন: ক্লড কোডের (Claude Code) তুলনায়, যা কেবল ডেস্কটপেই সৃজনশীলতাকে প্রসারিত করতে পারে, ওপেনক্ল (OpenClaw) ব্যবহারকারীদের যেকোনো সময়, যেকোনো স্থানে সৃজনশীল প্রক্রিয়ায় অংশগ্রহণের সুযোগ দেয় এবং এর কল্পনাশক্তি প্রসার কোনো নির্দিষ্ট পরিস্থিতি দ্বারা সীমাবদ্ধ থাকে না।

হুয়াং চাও ওপেনক্ল-এর ইন্টারঅ্যাকশন মোডের উপর আলোকপাত করে, এটি কেন ব্যাপক মনোযোগ আকর্ষণ করেছে তার কারণগুলো বিশ্লেষণ করেছেন।

তিনি বিশ্বাস করেন যে প্রথম মূল কারণটি হলো "জীবন্ত থাকার অনুভূতি"। কার্সর এবং ক্লড কোডের মতো পূর্ববর্তী এজেন্ট টুলগুলোকে যন্ত্রের মতোই মনে হতো; ওপেনক্ল, তার অন্তর্নির্মিত আইএম সফটওয়্যার ইন্টারঅ্যাকশনের মাধ্যমে, আমাদের কল্পনার সেই ব্যক্তিগত জার্ভিসের কাছাকাছি মনে হয়। "জীবন্ত থাকার এই অনুভূতিই প্রথমবারের মতো অনেককে সত্যিকার অর্থে অনুভব করাচ্ছে যে এআই আসছে।"

দ্বিতীয় বিষয়টি হলো, ওপেনক্ল (OpenClaw) আবারও এজেন্ট লুপ ফ্রেমওয়ার্ক প্যারাডাইমকে বৈধতা দেয়, যা শুনতে সহজ মনে হলেও অত্যন্ত কার্যকর। বিবেচনার যোগ্য তৃতীয় প্রশ্নটি হলো, আমাদের কি একটি সর্বাঙ্গীণ অতি-বুদ্ধিমান এজেন্ট প্রয়োজন, নাকি সম্পূর্ণ ইকোসিস্টেমের মধ্যে থাকা সমস্ত টুলস ও সক্ষমতা কাজে লাগানোর জন্য একটি হালকা অপারেটিং সিস্টেম বা স্কাফোল্ডিং প্রয়োজন।

তিনি দ্বিতীয়টির দিকেই বেশি ঝোঁকেন, এই বিশ্বাসে যে অপারেটিং সিস্টেম স্তরে ওপেনক্ল অনেকটা একজন ছোট ভৃত্যের মতো। এই প্রবেশপথের মাধ্যমে কমিউনিটির আরও বেশি সংখ্যক মানুষ এই ধরনের সিস্টেমের জন্য অ্যাপ্লিকেশন ডিজাইন করা শুরু করছেন, যা বিভিন্ন শিল্পকে দক্ষতা ও সক্ষমতার মাধ্যমে শক্তিশালী করছে। এটি স্বাভাবিকভাবেই সমগ্র ওপেন সোর্স ইকোসিস্টেমের সাথে খুব ঘনিষ্ঠভাবে সংযুক্ত।

একটি কাজ সম্পন্ন করতে, আপনাকে মূল পরিমাণের ১০০ গুণ টোকেন ব্যবহার করতে হবে।

এরপর ইয়াং ঝিলিন ঝিপুর সদ্য উন্মোচিত জিএলএম-৫-টার্বো মডেল এবং এর সাথে তৎসম্পর্কিত মূল্যবৃদ্ধির কৌশলের দিকে প্রশ্নটি ছুঁড়ে দিয়ে জানতে চান, এটি বাজারের কোন সংকেতকে প্রতিফলিত করছে।

ঝাং পেং বলেছেন যে, এই আপডেটটি সামগ্রিক উন্নয়ন লক্ষ্যমাত্রার অংশ হিসেবে নির্ধারিত সময়ের আগেই প্রকাশিত একটি পর্যায়ক্রমিক সাফল্য। এর মূল উদ্দেশ্য একটাই: ‘আলোচনা’ থেকে ‘কাজে পরিণত হওয়া’-র দিকে অগ্রসর হওয়া। ওপেনক্ল (OpenClaw) সবাইকে উপলব্ধি করিয়েছে যে, বড় মডেল সত্যিই মানুষকে কাজ সম্পন্ন করতে সাহায্য করতে পারে, কিন্তু এর পেছনে মডেলের সক্ষমতার যে চাহিদা, তা আগের চেয়ে অনেক বেশি।

এর জন্য দীর্ঘমেয়াদী কাজের পরিকল্পনা করা, ক্রমাগত প্রেক্ষাপট সংকুচিত করা, যেকোনো সময় ডিবাগ করা এবং বহুবিধ তথ্য প্রক্রিয়াকরণ করা প্রয়োজন। এটি প্রচলিত সাধারণ-উদ্দেশ্যমূলক সংলাপ মডেল থেকে সম্পূর্ণ ভিন্ন।

GLM-5-Turbo এই ক্ষেত্রগুলিতে নির্দিষ্ট উন্নতি সাধন করেছে, বিশেষ করে মডেলটিকে কীভাবে ক্রমাগত লুপ করতে এবং কাজ সম্পাদন করতে সক্ষম করা যায়, সেই বিষয়ে। এটি কর্মদক্ষতার অপ্টিমাইজেশনও করেছে, যা জটিল কাজগুলি পরিচালনা করার জন্য আরও কার্যকর ইনফারেন্স পাথ তৈরি করে এবং ব্যবহারকারীদের শুধু তাদের বিলের সংখ্যা ক্রমাগত কমতে দেখার প্রবণতা থেকে বিরত রাখে।

মূল্যবৃদ্ধি প্রসঙ্গে তার মতে, এখন একটি জটিল কাজ সম্পন্ন করতে মডেলের পেছনে একটি দীর্ঘ ইনফারেন্স চেইন জড়িত থাকে, যার জন্য কোডিং, অন্তর্নিহিত অবকাঠামোর সাথে মিথস্ক্রিয়া এবং ক্রমাগত ত্রুটি সংশোধনের প্রয়োজন হয়। এতে ব্যবহৃত টোকেনের পরিমাণ একটি সাধারণ প্রশ্নের উত্তর দেওয়ার চেয়ে দশ বা এমনকি একশ গুণ বেশি হতে পারে। মডেল যত বড় হয়, ইনফারেন্স খরচও সেই অনুযায়ী বৃদ্ধি পায় এবং দাম স্বাভাবিকভাবেই তার সাধারণ বাণিজ্যিক মূল্যে ফিরে আসবে।

দীর্ঘমেয়াদে স্বল্পমূল্যের প্রতিযোগিতার উপর নির্ভর করা সমগ্র শিল্পের উন্নয়নের জন্য ক্ষতিকর। আমাদের মডেলের সক্ষমতা ক্রমাগত উন্নত করতে এবং সকলকে আরও ভালো পরিষেবা প্রদানের জন্য ব্যবসার একটি ইতিবাচক চক্র প্রয়োজন।

বিদ্যমান ক্লাউড কম্পিউটিং আর্কিটেকচারগুলো এআই-এর জন্য ডিজাইন করা হয়নি।

টোকেন ব্যবহারের ব্যাপক বৃদ্ধি এবং ইন্ডাস্ট্রির ট্রেনিং যুগ থেকে ইনফারেন্স যুগে স্থানান্তরের ফলে, ইনফারেন্স ইনফ্রাস্ট্রাকচারের উপর চাপ একটি অনিবার্য বিষয়ে পরিণত হয়েছে।

জিয়া লিশুয়ে বলেছেন যে, উওয়েনশিনচিওং হলো এআই যুগে জন্ম নেওয়া একটি অবকাঠামো সরবরাহকারী প্রতিষ্ঠান। বর্তমানে, এটি কিমি, ঝিপু এবং অনেক বিশ্ববিদ্যালয় ও গবেষণা প্রতিষ্ঠানকে পরিষেবা প্রদান করে এবং মেমোর সাথেও সহযোগিতা করছে। তারা একটি মূল প্রশ্ন নিয়ে চিন্তা করে আসছে: এজিআই যুগে কী ধরনের অবকাঠামো প্রয়োজন এবং কীভাবে তা ধাপে ধাপে বাস্তবায়ন ও অনুধাবন করা যায়।

তার মতে, বর্তমানে সবচেয়ে জরুরি বিষয় হলো কীভাবে আরও কার্যকর একটি টোকেন ফ্যাক্টরি তৈরি করা যায়।

উওয়েন চিপের পদ্ধতি হলো সফটওয়্যার ও হার্ডওয়্যারকে একীভূত করা, চীনের প্রায় সব ধরনের কম্পিউটিং চিপকে সংযুক্ত করা এবং কয়েক ডজন চিপ ও কয়েক ডজন ভিন্ন কম্পিউটিং পাওয়ার ক্লাস্টারকে একসাথে যুক্ত করা। "যখন সম্পদ অপর্যাপ্ত থাকে, তখন দুটি সেরা উপায় আছে: প্রথমত, সমস্ত উপলব্ধ সম্পদের পূর্ণ ব্যবহার করা; দ্বিতীয়ত, রূপান্তর দক্ষতা সর্বাধিক করার জন্য কম্পিউটিং শক্তির প্রতিটি বিট যেন কার্যকরভাবে ব্যবহৃত হয় তা নিশ্চিত করা।" তারা এও খতিয়ে দেখছে যে সর্বশেষ মডেল কাঠামো এবং হার্ডওয়্যার কাঠামো আরও গভীর সমন্বয় তৈরি করতে পারে কিনা।

তবে, তিনি মনে করেন যে শুধু একটি মানসম্মত টোকেন ফ্যাক্টরি তৈরি করাই যথেষ্ট নয়। তিনি আরও একটি মৌলিক সিদ্ধান্তে উপনীত হন: বর্তমান ক্লাউড কম্পিউটিং পরিকাঠামোটি কৃত্রিম বুদ্ধিমত্তার (এআই) জন্য নয়, বরং মানব প্রকৌশলীদের সেবা দেওয়ার জন্য ডিজাইন করা হয়েছে। "আমরা মানুষের জন্য ডিজাইন করা ইন্টারফেসসহ একটি পরিকাঠামো তৈরি করেছি, এবং তারপর ইন্টেলিজেন্ট এজেন্টদের সাথে সংযোগ স্থাপনের জন্য এটিকে আরেকটি স্তর দিয়ে মুড়ে দিতে হয়। এই পদ্ধতিটি ইন্টেলিজেন্ট এজেন্টদের মানবিক সক্ষমতা ব্যবহার করে কাজ করার সুযোগকে সীমিত করে দেয়।"

তিনি একটি বাস্তব উদাহরণ দিলেন: বুদ্ধিমান এজেন্টরা কয়েক সেকেন্ড বা এমনকি কয়েক মিলিসেকেন্ডের মধ্যে চিন্তা করে কাজ শুরু করতে পারে, কিন্তু বিদ্যমান অনেক অন্তর্নিহিত সক্ষমতা এই গতির জন্য প্রস্তুত নয়, কারণ মানুষ সাধারণত একটি কাজ শুরু করতে কয়েক মিনিট সময় নেয়। এই সমস্যার জন্য আরও বুদ্ধিমান একটি নিয়ন্ত্রণ ব্যবস্থা গড়ে তোলা প্রয়োজন, যাকে তারা এজেন্সির সক্ষমতার অংশ বলে অভিহিত করেন।

দীর্ঘমেয়াদী দৃষ্টিকোণ থেকে তিনি বিশ্বাস করেন যে, যখন সত্যিকারের এজিআই যুগ আসবে, তখন এমনকি স্বয়ং পরিকাঠামোটিও একটি বুদ্ধিমান এজেন্টে পরিণত হওয়া উচিত, যা আত্ম-বিবর্তন ও আত্ম-পুনরাবৃত্তিতে সক্ষম হয়ে একটি স্বায়ত্তশাসিত সংস্থা গঠন করবে। "বিষয়টা এমন যে, পরিকাঠামোটির একজন সিইও আছেন, এবং এই সিইও হলেন এমন একজন এজেন্ট যিনি এআই ক্লায়েন্টদের চাহিদার ভিত্তিতে নির্দেশ দেন এবং নিজের পরিকাঠামোকে পুনরাবৃত্তি করেন। শুধুমাত্র এইভাবেই এআই এবং পরিকাঠামোর মধ্যে সত্যিকারের সংযোগ তৈরি করা সম্ভব, এমন একমুখী সম্পর্কের পরিবর্তে যেখানে একজন নির্দেশ গ্রহণ করে এবং অন্যজন তা সম্পাদন করে।"

তারা এজেন্টদের মধ্যে যোগাযোগ উন্নত করার এবং ক্যাশ-টু-ক্যাশ রেপ্লিকেশন সক্ষমতা বাড়ানোর উপায়ও খতিয়ে দেখছেন। তার মতে, পরিকাঠামো এবং এআই-এর উন্নয়ন একটি সমৃদ্ধ সমন্বয় তৈরি করবে; এটাই প্রকৃত হার্ডওয়্যার-সফ্টওয়্যার সহযোগিতা, এবং এটাই সেই লক্ষ্য যা উওয়েন চিপ সবসময় অর্জন করতে চেয়েছে।

কম্পিউটিং ক্ষমতার সীমাবদ্ধতা অপ্রত্যাশিতভাবে একটি যুগান্তকারী সাফল্যের দিকে পরিচালিত করেছে।

শাওমির অনন্য সুবিধাগুলোর সরাসরি উল্লেখ করার পরিবর্তে, লুও ফুলি সমগ্র চীনা বৃহৎ মডেল দলের বৃহত্তর প্রেক্ষাপটের দিকে মনোযোগ সরিয়ে নেন, কারণ তিনি বিশ্বাস করতেন যে এই দৃষ্টিভঙ্গিটিই অধিক মূল্যবান।

তিনি বলেন যে, প্রায় দুই বছর আগে তিনি চীনের বৃহৎ মডেল দলটিকে একটি অত্যন্ত গুরুত্বপূর্ণ অগ্রগতি শুরু করতে দেখেছিলেন। এই অগ্রগতিটি এসেছিল তাদের উপর চাপিয়ে দেওয়া একটি প্রস্তাবনা থেকে: কীভাবে নিম্ন-স্তরের কম্পিউটিং ক্ষমতার সীমাবদ্ধতা, বিশেষ করে এনভি-লিঙ্ক (NVLink) ইন্টারকানেক্টের সীমিত ব্যান্ডউইথ, অতিক্রম করা যায় এবং কার্যকারিতার সাথে আপাতদৃষ্টিতে আপোস করেও মডেলের কাঠামোতে উদ্ভাবন আনা যায়।

DeepSeek V2, V3 সিরিজ এবং পরবর্তীকালের MiniMax M1 সবই এই ধরনের অনুসন্ধানের ফসল।

এই উদ্ভাবনগুলো একটি সত্যিকারের বিপ্লব ঘটিয়েছে: একটি নির্দিষ্ট কম্পিউটিং ক্ষমতা দিয়ে কীভাবে বুদ্ধিমত্তার স্তরকে সর্বোচ্চ করা যায়। ডিপসিক দেশের সমস্ত বৃহৎ মডেল টিমকে সাহস ও আত্মবিশ্বাস জুগিয়েছে। তিনি জোর দিয়ে বলেন যে, যদিও বর্তমানে দেশীয় চিপের উপর বিধিনিষেধ ততটা কঠোর নয়, তবুও এই সময়ে উচ্চতর প্রশিক্ষণ দক্ষতা এবং কম ইনফারেন্স খরচ সহ মডেল কাঠামোর অন্বেষণ, যা করতে বাধ্য করা হয়েছিল, তা সত্যিই মূল্যবান প্রযুক্তিগত সঞ্চয় তৈরি করেছে।

তিনি কয়েকটি নির্দিষ্ট দিকের কথা উল্লেখ করেছেন: হাইব্রিড স্পার্স আর্কিটেকচার, কিমির কেএসএ আর্কিটেকচার এবং পরবর্তী প্রজন্মের জন্য শাওমির নতুন কাঠামো। এগুলি সবই বর্তমান প্রজন্মের ট্রান্সফরমার আর্কিটেকচার থেকে ভিন্ন এবং ইন্টেলিজেন্ট এজেন্টের যুগের জন্য কীভাবে আরও উন্নত মডেল কাঠামোর উদ্ভাবন করা যায়, তা নিয়ে ভাবছে।

তিনি বিশেষভাবে দীর্ঘমেয়াদী প্রাসঙ্গিক সক্ষমতার গুরুত্বের ওপর জোর দেন এবং এটিকে সরাসরি ওপেনক্ল-এর সাথে যুক্ত করেন।

আপনার ইনফারেন্স কনটেক্সট যথেষ্ট দীর্ঘ হলে, আপনি OpenClaw যত বেশি ব্যবহার করবেন, এটি তত উন্নত ও স্মার্ট হবে। কিন্তু অনেক মডেল এক বা এমনকি দশ মেগাবাইট কনটেক্সটও সামলাতে পারে না, এর কারণ সক্ষমতা নয়, বরং খরচ। এটি বাস্তবায়ন করা অত্যন্ত ব্যয়বহুল এবং ধীরগতির। শুধুমাত্র যখন খরচ কম থাকে এবং দীর্ঘ কনটেক্সটের অধীনে গতি যথেষ্ট দ্রুত হয়, তখনই আমরা মডেলের উপর সত্যিকারের ফলপ্রসূ এবং জটিল কাজগুলো অর্পণ করতে পারি।

তিনি এই পথের শেষ বিন্দুটি আরও বর্ণনা করেছেন: অতি-দীর্ঘ প্রেক্ষাপটের সহায়তায়, মডেলগুলো জটিল পরিবেশে নিজেদের বিকশিত করতে পারে, যার মধ্যে ফ্রেমওয়ার্কটিকেই অপ্টিমাইজ করা এবং মডেলের প্যারামিটারগুলোর পুনরাবৃত্তি করা অন্তর্ভুক্ত। এই পদ্ধতির জন্য প্রি-ট্রেনিং পর্যায়ে একটি শক্তিশালী দীর্ঘ-প্রেক্ষাপট আর্কিটেকচার এবং পোস্ট-ট্রেনিং পর্যায়ে আরও কার্যকর লার্নিং অ্যালগরিদম তৈরি করা প্রয়োজন, যার জন্য এক-মেগাবাইট, দশ-মেগাবাইট বা এমনকি একশ-মেগাবাইট প্রেক্ষাপটের মধ্যে বাস্তব, দীর্ঘমেয়াদী নির্ভরশীল টেক্সট এবং জটিল পরিবেশগত গতিপথের ডেটা সংগ্রহ করতে হয়।

তিনি দলের অভ্যন্তরীণ কিছু তথ্যও তুলে ধরেছেন: ক্লড কোড এবং সেরা মডেলের সমন্বয়ে, বৃহৎ পরিসরে মডেল গবেষণাকারী দলের সদস্যরা তাদের গবেষণার দক্ষতা প্রায় দশগুণ বাড়িয়েছেন।

পরিকল্পনা, স্মৃতি এবং সরঞ্জাম ব্যবহার

হুয়াং চাও প্রযুক্তিগত দৃষ্টিকোণ থেকে বর্তমান ইন্টেলিজেন্ট এজেন্ট ফ্রেমওয়ার্কের তিনটি মূল মডিউলের প্রধান দুর্বলতা এবং ভবিষ্যৎ দিকনির্দেশনাগুলো পদ্ধতিগতভাবে পর্যালোচনা করেছেন।

পরিকল্পনার দৃষ্টিকোণ থেকে, তিনি মনে করেন যে জটিল কাজ এবং অত্যন্ত দীর্ঘ প্রেক্ষাপটের জন্য পরিকল্পনা করার ক্ষমতা এখনও অপর্যাপ্ত। উদাহরণস্বরূপ, অনেক মডেল ৫০০ বা তারও বেশি ধাপের ডেপ্লয়মেন্ট টাস্কে ভালোভাবে কাজ করতে ব্যর্থ হয়, যার মূল কারণ হলো সংশ্লিষ্ট ভার্টিকাল ডোমেইনের মধ্যে অন্তর্নিহিত জ্ঞানের অভাব। তিনি পরামর্শ দেন যে, একটি উপায় হলো জটিল কাজের জন্য ডোমেইন জ্ঞানকে মডেলের মধ্যে অন্তর্ভুক্ত করা। স্কিল এবং হার্নেসের মতো টুলগুলো উচ্চ-মানের বাহ্যিক সক্ষমতা প্রদানের মাধ্যমে পরিকল্পনার ত্রুটি কিছুটা হলেও প্রশমিত করে।

মেমরি স্তরে, তথ্য সংকোচন এবং পুনরুদ্ধারের নির্ভুলতা ক্রমাগত চ্যালেঞ্জ হিসেবে রয়ে গেছে। কাজের জটিলতা বাড়ার সাথে সাথে প্রেক্ষাপটও দ্রুতগতিতে বৃদ্ধি পায়, এবং বর্তমানে বেশিরভাগ ইন্টেলিজেন্ট এজেন্ট ফ্রেমওয়ার্ক এখনও সবচেয়ে সহজ শেয়ারিং পদ্ধতি—ফাইল সিস্টেমের—উপর নির্ভর করে। তিনি বিশ্বাস করেন যে ভবিষ্যতের মেমরি মেকানিজমগুলোকে একটি শ্রেণিবদ্ধ নকশার দিকে যেতে হবে, কিন্তু এর সাধারণীকরণ অর্জন করা কঠিন, কারণ কোডিং, গভীর গবেষণা এবং মাল্টিমিডিয়া ক্ষেত্রে ডেটার ধরণ ব্যাপকভাবে ভিন্ন। কীভাবে দক্ষতার সাথে এই মেমরি পুনরুদ্ধার এবং সূচীবদ্ধ করা যায়, তা এখনও একটি আপস-মীমাংসার বিষয়।

তিনি চাপের একটি নতুন উৎসের দিকেও ইঙ্গিত করেছেন: ভবিষ্যতে হয়তো শুধু একজন এজেন্ট থাকবে না; প্রত্যেক ব্যক্তির একই সাথে একদল এজেন্ট থাকতে পারে। কিমির এজেন্ট সোয়ার্ম মেকানিজম ইতিমধ্যেই এই দিকেই ইঙ্গিত করছে। একদল এজেন্টের দ্বারা সৃষ্ট কনটেক্সট সার্জ একজন একক এজেন্টের চেয়ে অনেক বেশি হবে, যা মেমোরি মেকানিজম এবং সমগ্র এজেন্ট আর্কিটেকচারের উপর প্রচণ্ড চাপ সৃষ্টি করবে। বর্তমানে এই সমস্যা মোকাবেলার জন্য কোনো পরিপক্ক মেকানিজম নেই।

টুল ব্যবহারের স্তরে, তিনি মনে করেন উচ্চ-মানের দক্ষতার অভাব রয়েছে, যা এমসিপি (MCP) যুগের উচ্চ-মানের টুলের অভাবেরই প্রতিচ্ছবি। নিম্ন-মানের দক্ষতা সরাসরি কাজ সম্পন্ন করার হার কমিয়ে দেয় এবং ক্ষতিকর অনুপ্রবেশের নিরাপত্তা ঝুঁকিও একটি বড় উদ্বেগের বিষয়। তিনি যুক্তি দেন যে এর জন্য পুরো কমিউনিটির সম্মিলিত প্রচেষ্টা প্রয়োজন, এমনকি ম্যানুয়াল প্রি-সেটিংয়ের উপর নির্ভর না করে, কাজ সম্পাদনের সময় কীভাবে নতুন দক্ষতাগুলোকে গতিশীলভাবে বিকশিত করা যায়, সেই উপায়গুলোও খতিয়ে দেখা দরকার।

আগামী বারো মাস: বাস্তুতন্ত্র, স্ব-বিবর্তন, টেকসই টোকেন এবং কম্পিউটিং শক্তি

ফোরামের শেষে ইয়াং ঝিলিন প্রত্যেক অতিথিকে একটি মূলশব্দ ব্যবহার করে আগামী বারো মাসের সবচেয়ে গুরুত্বপূর্ণ প্রবণতা বর্ণনা করতে বলেন।

হুয়াং চাও মন্তব্য করেন যে, কৃত্রিম বুদ্ধিমত্তার ক্ষেত্রে বারো মাস একটি অনেক দূরের সময়, এবং তিনি ভাবছিলেন ততদিনে এর রূপটি কেমন হবে। তাঁর মূল শব্দটি ছিল "ইকোসিস্টেম"। তিনি বিশ্বাস করেন যে, যদিও মানুষ বর্তমানে নতুনত্বের অনুভূতি নিয়ে ইন্টেলিজেন্ট এজেন্ট ব্যবহার করছে, আসল চ্যালেঞ্জটি হলো সেগুলোকে দৈনন্দিন সরঞ্জামগুলোর সাথে একীভূত করা এবং ব্যক্তিগত সহকারী থেকে সত্যিকারের কর্মী ও সহকর্মীতে রূপান্তরিত করা। এর জন্য প্রয়োজন মডেলের পুনরাবৃত্তি, দক্ষতা প্ল্যাটফর্মের উন্নয়ন এবং সমগ্র ইকোসিস্টেমকে একটি আরও সহজাত ইন্টেলিজেন্ট এজেন্ট মডেলের দিকে চালিত করার জন্য বিভিন্ন সরঞ্জামের সম্মিলিত প্রচেষ্টা।

তিনি একটি আকর্ষণীয় ভবিষ্যদ্বাণীও করেছেন: ভবিষ্যতে, অনেক সফটওয়্যার হয়তো আর মানুষের জন্য নয়, বরং ইন্টেলিজেন্ট এজেন্টদের জন্য ডিজাইন করা হবে। মানুষের গ্রাফিক্যাল ইউজার ইন্টারফেস (GUI) প্রয়োজন, কিন্তু ইন্টেলিজেন্ট এজেন্টদের তা প্রয়োজন নেই; পুরো ইকোসিস্টেমটি GUI এবং MCP (মাল্টি-ক্লায়েন্ট প্রোগ্রামিং) মডেল থেকে CLI (ক্লায়েন্ট-সার্ভিস ইন্টারফেস) মডেলে স্থানান্তরিত হচ্ছে। এর অর্থ হলো, সফটওয়্যার সিস্টেম, ডেটা, এমনকি বিভিন্ন প্রযুক্তি—সবকিছুকেই এজেন্ট-নেটিভ ডিজাইনের দিকে রূপান্তরিত হতে হবে।

লুও ফুলি ‘স্ব-বিবর্তন’ শব্দটি ব্যবহার করেছেন। তিনি বলেন, ধারণাটি শুনতে কিছুটা বিমূর্ত মনে হলেও, সম্প্রতি তিনি এ বিষয়ে আরও সুস্পষ্ট ধারণা ও বাস্তবসম্মত একটি পদ্ধতি লাভ করেছেন। মূল বিষয়টি হলো: একটি যথেষ্ট শক্তিশালী মডেলের ক্ষেত্রে, যখন আপনি এজেন্ট ফ্রেমওয়ার্কে একটি যাচাইযোগ্য সীমাবদ্ধতা যোগ করেন এবং একটি নিরবচ্ছিন্ন লুপ চালু করেন, যা মডেলটিকে পুনরাবৃত্তিমূলকভাবে লক্ষ্যকে অপ্টিমাইজ করার সুযোগ দেয়, তখন আপনি দেখবেন যে এটি ক্রমাগত আরও ভালো সমাধান বের করতে পারে এবং দুই বা তিন দিন ধরে স্বয়ংক্রিয়ভাবে চলতে পারে।

তিনি একটি নির্দিষ্ট উদাহরণ তুলে ধরেন: সুস্পষ্ট মূল্যায়ন মানদণ্ডযুক্ত গবেষণামূলক কাজে, যেমন উন্নততর মডেল কাঠামো অন্বেষণে, মডেলটি ইতোমধ্যেই দুই বা তিন দিন ধরে স্বয়ংক্রিয়ভাবে পরিচালিত ও কার্যকর হতে পারে। "এই পৃথিবীতে এখনও অস্তিত্বহীন নতুন কিছু সৃষ্টির একমাত্র পথ হলো স্ব-পুনরাবৃত্তি। এর উদ্দেশ্য মানুষের উৎপাদনশীলতাকে প্রতিস্থাপন করা নয়, বরং শীর্ষ বিজ্ঞানীদের মতো অজানাকে অন্বেষণ করা। এক বছর আগে আমি ভেবেছিলাম এতে তিন থেকে পাঁচ বছর সময় লাগবে, কিন্তু এখন আমার মনে হয় এটি এক থেকে দুই বছরের মধ্যেই সত্যিকার অর্থে অর্জন করা সম্ভব।"

তিনি প্রত্যাশা করেন যে, একটি শক্তিশালী স্ব-পুনরাবৃত্তিমূলক এজেন্ট কাঠামোর সাথে মিলিত হয়ে বৈজ্ঞানিক গবেষণার গতি সূচকীয় হারে বৃদ্ধি পাবে।

জিয়া লিশুয়ে ‘টেকসই টোকেন’ বেছে নিয়েছেন। তিনি বলেন যে, সম্পূর্ণ উন্নয়ন প্রক্রিয়াটি এখনও চলমান এবং এটিকে টেকসই হতে হবে। তিনি তার রূপকল্প বর্ণনা করতে ‘এআই মেড ইন চায়না’ কথাটি ব্যবহার করেছেন: একটি দক্ষ টোকেন কারখানার মাধ্যমে চীনের জ্বালানি ও কম্পিউটিং ক্ষমতার সুবিধাগুলোকে কাজে লাগিয়ে সেগুলোকে ক্রমাগত উচ্চ-মানের এআই সক্ষমতায় রূপান্তরিত করা এবং বিশ্বব্যাপী রপ্তানি করা।

‘মেড ইন চায়না’ থেকে ‘এআই মেড ইন চায়না’ পর্যন্ত যুক্তিটা একই। চীন তার স্বল্প খরচের উৎপাদন ক্ষমতাকে বিশ্বব্যাপী রপ্তানির জন্য উচ্চ-মানের পণ্যে রূপান্তরিত করতে পারে এবং একইভাবে এই ক্ষমতাকে টোকেন উৎপাদন ও রপ্তানিতেও স্থানান্তর করতে পারে। তিনি আশা করেন, এ বছর এটি বাস্তবে রূপ নেবে এবং চীনকে বিশ্বের টোকেন কারখানায় পরিণত করবে।

ঝাং পেং-এর মূল শব্দটি হলো 'কম্পিউটিং শক্তি'।

তার মতে, "সকল প্রযুক্তির মূল ভিত্তি হলো এটি যেন সকলের ক্রয়ক্ষমতার মধ্যে থাকে। আপনি একটি প্রশ্ন করবেন, সেটির উত্তর ভাবতে অনেক সময় লাগবে, অথচ শুধুমাত্র কম্পিউটিং ক্ষমতা অপর্যাপ্ত বলে তার উত্তর দেওয়া হবে না—এটা কোনোভাবেই গ্রহণযোগ্য নয়।"

তিনি ইন্ডাস্ট্রিতে প্রচলিত একটি প্রবাদ উল্লেখ করেছেন: "কার্ড নেই, অনুভূতিও নেই; কার্ড নিয়ে কথা বললে অনুভূতিতে আঘাত লাগে।" চাহিদা দশগুণ বা এমনকি একশগুণ পর্যন্ত বেড়েছে, এবং সেই চাহিদার একটি বড় অংশ এখনও অপূর্ণ রয়ে গেছে। তিনি বিশ্বাস করেন যে কম্পিউটিং শক্তিই সবচেয়ে জরুরি বিষয়, যা আগামী বারো মাসের মধ্যে সমাধান করার জন্য সকলের সম্মিলিত প্রচেষ্টা প্রয়োজন। লবস্টার কল্পনার সীমা উন্মোচন করেছে, কিন্তু কম্পিউটিং শক্তি, আর্কিটেকচার এবং অবকাঠামো এখনও উন্নতির পথে রয়েছে।

iFanr-এর অফিসিয়াল WeChat অ্যাকাউন্ট: iFanr (WeChat ID: ifanr) ফলো করুন, যেখানে যত তাড়াতাড়ি সম্ভব আপনার জন্য আরও আকর্ষণীয় কন্টেন্ট উপস্থাপন করা হবে।