SentinelOne-এর একটি নতুন বেঞ্চমার্ক দেখিয়েছে যে কীভাবে আধুনিক এআই মডেলগুলো জটিল ম্যালওয়্যার তদন্তের সময় ভুল করে। Fast16 নামক একটি ম্যালওয়্যার ব্যবহার করে এই পরীক্ষা চালানো হয়েছে।
SentinelOne তাদের নতুন 'লং-হরাইজন রিভার্স-ইঞ্জিনিয়ারিং বেঞ্চমার্ক' প্রকাশ করেছে, যেখানে Fast16 নামক একটি ম্যালওয়্যারকে পরীক্ষা হিসেবে ব্যবহার করা হয়েছে। Fast16 হলো ২০০৫ সালের একটি উইন্ডোজ ম্যালওয়্যার যা ইরানের পারমাণবিক কর্মসূচিতে ব্যবহৃত ইঞ্জিনিয়ারিং সফটওয়্যারে বাধা দেওয়ার জন্য তৈরি করা হয়েছিল।
গবেষকরা OpenAI-এর GPT-5.5, GPT-5.6 Sol, Z.ai-এর GLM-5.2 এবং Anthropic-এর Opus মডেলগুলিকে পরীক্ষা করেছেন। দেখা গেছে, শুধুমাত্র GPT-5.6 Sol আটটি ধাপের সম্পূর্ণ তদন্ত সম্পন্ন করতে পেরেছে। অন্যান্য মডেলগুলো প্রাথমিক পর্যায়েই আটকে গেছে বা ভুল সিদ্ধান্ত গ্রহণ করেছে।
SentinelLabs-এর মতে, এই ব্যর্থতার কারণ হলো 'প্রজেক্ট-স্কেল রিকভারি'র অভাব। অর্থাৎ, একটি ভুল সিদ্ধান্ত সংশোধন করে পুরো তদন্ত প্রক্রিয়াকে পুনরায় সঠিক পথে আনার ক্ষমতা মডেলগুলোর কম। গবেষকরা জানিয়েছেন যে, এআই যতই উন্নত হোক না কেন, ম্যালওয়্যার তদন্তে মানুষের তত্ত্বাবধান এখনও অপরিহার্য।