গবেষকরা এলএলএম (LLM) বা লার্জ ল্যাঙ্গুয়েজ মডেলের অভ্যন্তরে নির্দিষ্ট কিছু জ্ঞানীয় উপাদান (Cognitive Elements) শনাক্ত করার প্রস্তাব দিয়েছেন, যা এআই সিস্টেমের অনাকাঙ্ক্ষিত কাজ করার সম্ভাবনা নির্দেশ করতে পারে।

বর্তমানে এআই বা লার্জ ল্যাঙ্গুয়েজ মডেলের (LLM) নিরাপত্তা নিশ্চিত করার ক্ষেত্রে মডেলটিকে একটি 'ব্ল্যাক বক্স' হিসেবে বিবেচনা করা হয়, যেখানে শুধুমাত্র ইনপুট এবং আউটপুট বিশ্লেষণ করা হয়। এর ফলে নিরাপত্তা ব্যবস্থা অনেক সময় জটিল এবং নির্দিষ্ট মডেলের জন্য সীমাবদ্ধ হয়ে পড়ে। গবেষকরা এখন এই পদ্ধতির পরিবর্তন ঘটাতে চাইছেন যাতে মডেলের অভ্যন্তরীণ কার্যপ্রক্রিয়া বোঝা সম্ভব হয়।

ব্ল্যাক হ্যাট ইউএসএ ২০২৬-এ গবেষকরা একটি নতুন পদ্ধতি উপস্থাপন করবেন, যা 'অ্যাক্টিভেশন অ্যানালাইসিস'-এর ওপর ভিত্তি করে কাজ করবে। এটি কোনো নির্দিষ্ট মডেলের ওপর নির্ভরশীল নয়। পরিবর্তে, এটি 'কগনিটিভ এলিমেন্টস' বা জ্ঞানীয় উপাদানের একটি সূক্ষ্ম তালিকা ব্যবহার করবে। উদাহরণস্বরূপ, 'কন্টেন্ট তৈরি করা' এবং 'ব্যক্তিগত তথ্য প্রদান করা'র মতো উপাদানগুলো একত্রিত করে ফিশিং আক্রমণের মতো সম্ভাব্য ঝুঁকি শনাক্ত করা সম্ভব হবে।

গবেষকরা 'GAVEL' নামক একটি সিস্টেম তৈরির লক্ষ্য রাখছেন, যা এআই-এর নিউরাল অ্যাক্টিভেশনের মাধ্যমে ক্ষতিকারক আচরণ শনাক্ত করতে পারবে। এই পদ্ধতির সুবিধা হলো এটি ভাষা-নিরপেক্ষ; অর্থাৎ আক্রমণকারী অন্য কোনো ভাষা ব্যবহার করেও এআই-কে বিভ্রান্ত করার চেষ্টা করলে, মডেলের অভ্যন্তরীণ নিউরাল প্যাটার্ন দেখে তা ধরা পড়বে।