AI அமைப்புகள் தேவையற்ற செயல்களில் ஈடுபடுவதைக் கண்டறிய, LLM-களின் குறிப்பிட்ட அறிவாற்றல் கூறுகளை (Cognitive Elements) அடையாளம் காண்பதில் கவனம் செலுத்த ஆராய்ச்சியாளர்கள் முன்மொழிகின்றனர்.

தற்போதைய AI பாதுகாப்பு முறைகள் பெரும்பாலும் லார்ஜ் லாங்குவேஜ் மாடல்களை (LLM) ஒரு 'பிளாக் பாக்ஸ்' போல கருதுகின்றன. அதாவது, உள்ளீடு மற்றும் வெளியீடுகளை மட்டுமே பகுப்பாய்வு செய்கின்றன, ஆனால் மாடலுக்குள் என்ன நடக்கிறது என்பதைப் பார்ப்பதில்லை. இதனால் பாதுகாப்பு நுட்பங்கள் சிக்கலானதாகவும், குறிப்பிட்ட மாடல்களுக்கு மட்டுமே பொருந்தக்கூடியதாகவும் உள்ளன.

ஆராய்ச்சியாளர்கள் இந்த முறையை மாற்ற விரும்புகிறார்கள். ஆகஸ்ட் மாதம் நடைபெறவிருக்கும் Black Hat USA 2026 மாநாட்டில், அவர்கள் ஒரு புதிய அணுகுமுறையை முன்வைக்க உள்ளனர். இது 'அக்டிவேஷன் அனாலிசிஸ்' (Activation Analysis) மூலம் செயல்படும். இது வெறும் வெறுப்புப் பேச்சு அல்லது சைபர் குற்றங்களை மட்டும் தரம் பிரிக்காமல், 'உள்ளடக்கம் உருவாக்குதல்' அல்லது 'தனிப்பட்ட தகவல் வழங்குதல்' போன்ற நுணுக்கமான அறிவாற்றல் கூறுகளைப் பயன்படுத்தித் தாக்குதல்களைக் கண்டறியும்.

'GAVEL' என்று அழைக்கப்படும் இந்த அமைப்பு, AI-ன் நரம்பியல் செயல்பாடுகளைக் கண்காணிப்பதன் மூலம் ஆபத்தான எண்ணங்களை முன்கூட்டியே கண்டறிய முயல்கிறது. இந்த முறை மொழி சார்பற்றது; அதாவது ஒரு தாக்குதல் நடத்துபவர் வேறு மொழியைப் பயன்படுத்தினாலும், AI-ன் உள்நிலை செயல்பாடுகள் மூலம் அந்தத் தாக்குதல் எளிதாகக் கண்டறியப்படும்.