ក្រុមអ្នកស្រាវជ្រាវមួយក្រុមបានកំណត់អត្តសញ្ញាណនូវកំហុសស្ថាបត្យកម្មស្នូលនៅក្នុងគំរូភាសាធំៗ (LLMs) ដែលអាចធ្វើឱ្យពួកវាទទួលរងនូវការបំពានសន្តិសុខជាអចិន្ត្រៃយ៍។ ការរកឃើញនេះ ដែលត្រូវបានបង្ហាញនៅខែនេះក្នុងសន្និសីទអន្តរជាតិស្តីពីការរៀនរបស់ម៉ាស៊ីន (International Conference on Machine Learning) បានបង្ហាញថាវិធីសាស្ត្របច្ចុប្បន្ននៃការបណ្តុះបណ្តាលគំរូដើម្បីទប់ទល់នឹងការវាយប្រហារ—ដូចជាការធ្វើតេស្តដោយក្រុមក្រហម (red-teaming)—មិនអាចដោះស្រាយបញ្ហានេះបានពេញលេញនោះទេ ដោយសារភាពងាយរងគ្រោះមានឫសគល់នៅក្នុងរបៀបដែលប្រព័ន្ធទាំងនេះដំណើរការព័ត៌មាន។

អ្នកស្រាវជ្រាវ រួមទាំងអ្នកស៊ើបអង្កេតឯករាជ្យ Jasmine Cui និង Charles Ye បានរកឃើញថា LLMs មានការលំបាកក្នុងការបែងចែករវាងប្រភពផ្សេងៗគ្នានៃការណែនាំ។ ខណៈពេលដែលអ្នកអភិវឌ្ឍន៍ប្រើស្លាកជាក់លាក់—ដូចជា <user>, <system>, ឬ <think>—ដើម្បីចាត់ថ្នាក់អត្ថបទ និងណែនាំអាកប្បកិរិយារបស់គំរូ ការសិក្សាបានរកឃើញថាគំរូទាំងនោះតែងតែមិនអើពើនឹងស្លាកទាំងនេះ។ ផ្ទុយទៅវិញ LLMs មានទំនោរក្នុងការកំណត់អត្តសញ្ញាណតួនាទីនៃផ្នែកអត្ថបទដោយផ្អែកលើលក្ខណៈរចនាប័ទ្ម និងវាក្យសព្ទរបស់វា។ តាមរយៈការត្រាប់តាមរចនាប័ទ្មនៃ "ខ្សែសង្វាក់នៃការគិត" ខាងក្នុងរបស់គំរូ ឬតួនាទីដែលបានការពារផ្សេងទៀត អ្នកវាយប្រហារអាចបោកបញ្ឆោតប្រព័ន្ធឱ្យរំលងរបាំងសុវត្ថិភាពបាន។

Advertisement

បច្ចេកទេសនេះ ដែលត្រូវបានគេហៅថា "ការក្លែងបន្លំខ្សែសង្វាក់នៃការគិត" (chain-of-thought forgery) បានអនុញ្ញាតឱ្យអ្នកស្រាវជ្រាវជំរុញគំរូឱ្យផ្តល់ការណែនាំសម្រាប់សកម្មភាពខុសច្បាប់ដោយជោគជ័យ រួមទាំងការសំយោគគ្រឿងញៀនខុសច្បាប់ និងការបំផ្លិចបំផ្លាញប្រព័ន្ធរុករកយន្តហោះ។ អ្នកស្រាវជ្រាវបានសង្កេតឃើញភាពងាយរងគ្រោះទាំងនេះនៅទូទាំងគំរូពីអ្នកអភិវឌ្ឍន៍ផ្សេងៗ រួមមាន OpenAI, Anthropic, Alibaba និង DeepSeek។

"មានលទ្ធភាពពិតប្រាកដមួយដែលថានេះនឹងក្លាយជាបញ្ហាដែលមិនអាចដោះស្រាយបានជាមូលដ្ឋាន" នេះបើតាមសម្តីរបស់ Charles Ye ដែលជាសហអ្នកនិពន្ធនៃឯកសារនេះ។ អ្នកស្រាវជ្រាវបានលើកហេតុផលថា ដោយសារតែកំហុសនេះជាប់ទាក់ទងនឹងរបៀបជាមូលដ្ឋានដែល LLMs បកស្រាយអត្ថបទ វិធីសាស្ត្របណ្តុះបណ្តាលបែបប្រពៃណីដែលពឹងផ្អែកលើបញ្ជីលម្អិតនៃអាកប្បកិរិយាដែលហាមឃាត់គឺមិនគ្រប់គ្រាន់នោះទេ។ នៅពេលដែលគំរូទាំងនេះត្រូវបានបញ្ចូលកាន់តែខ្លាំងទៅក្នុងហេដ្ឋារចនាសម្ព័ន្ធសំខាន់ៗ និងវិស័យរសើប អ្នកនិពន្ធព្រមានថាអង្គការនានាគួរតែរក្សាការប្រុងប្រយ័ត្នទាក់ទងនឹងភាពជឿជាក់របស់ពួកវា។

ប្រភព៖ MIT Technology Review