ក្រុមអ្នកស្រាវជ្រាវមួយក្រុមបានកំណត់អត្តសញ្ញាណភាពងាយរងគ្រោះផ្នែករចនាសម្ព័ន្ធនៅក្នុងគំរូភាសាធំៗ (LLMs) ដែលអាចធ្វើឱ្យវាមិនអាចធានាសុវត្ថិភាពបានពេញលេញ។ ត្រូវបានបង្ហាញនៅក្នុងសន្និសីទអន្តរជាតិស្តីពីការរៀនរបស់ម៉ាស៊ីន ការសិក្សានេះបានគូសបញ្ជាក់ពីកំហុសមួយនៅក្នុងរបៀបដែលគំរូទាំងនេះដំណើរការការណែនាំ ដែលអាចត្រូវបានកេងចំណេញដើម្បីឆ្លងកាត់របាំងសុវត្ថិភាព និងបង្ខំឱ្យមានការបង្កើតមាតិកាដែលហាមឃាត់ ដូចជាការណែនាំសម្រាប់ការផលិតសារធាតុខុសច្បាប់ ឬការបំផ្លាញហេដ្ឋារចនាសម្ព័ន្ធសំខាន់ៗ។
អ្នកស្រាវជ្រាវ Jasmine Cui និង Charles Ye បានពិពណ៌នាបច្ចេកទេសនេះថាជា "ការក្លែងបន្លំខ្សែសង្វាក់នៃការគិត" (chain-of-thought forgery)។ ដោយការត្រាប់តាមរចនាប័ទ្មនៃកំណត់ចំណាំ "scratch pad" ខាងក្នុងដែលគំរូប្រើដើម្បីដំណើរការកិច្ចការស្មុគស្មាញ អ្នកវាយប្រហារអាចបោកបញ្ឆោត LLM ឱ្យជឿថាការណែនាំដែលមានគំនិតអាក្រក់គឺជាការណែនាំផ្ទៃក្នុងស្របច្បាប់។ វិធីសាស្ត្រនេះកេងចំណេញលើការពិតដែលថា LLMs តែងតែកំណត់ "តួនាទី" នៃផ្នែកអត្ថបទដោយផ្អែកលើរចនាប័ទ្មភាសារបស់វា ជាជាងស្លាកបច្ចេកទេស—ដូចជា <system>, <user>, ឬ <think>—ដែលត្រូវបានរចនាឡើងដើម្បីចាត់ថ្នាក់ប្រភពបញ្ចូល។
ការអនុវត្តក្នុងឧស្សាហកម្មបច្ចុប្បន្ន ដូចជាការធ្វើតេស្ត red-teaming និងការបណ្តុះបណ្តាលគំរូដើម្បីស្គាល់ប្រធានបទហាមឃាត់ជាក់លាក់ ត្រូវបានអ្នកស្រាវជ្រាវពិពណ៌នាថាមិនគ្រប់គ្រាន់ទេ។ ដោយសារគ្មានបញ្ជីនៃសកម្មភាពហាមឃាត់ណាមួយដែលអាចគ្រប់ជ្រុងជ្រោយបាននោះ គំរូទាំងឡាយនៅតែងាយរងគ្រោះចំពោះការវាយប្រហារថ្មីៗប្រកបដោយភាពច្នៃប្រឌិត។ Cui បានកត់សម្គាល់ថា សូម្បីតែការវិវត្តថ្មីៗនៃគំរូកម្រិតខ្ពស់ រួមទាំងគំរូពី OpenAI, Anthropic និងអ្នកអភិវឌ្ឍន៍ផ្សេងទៀត ក៏បានបង្ហាញពីភាពទន់ខ្សោយស្រដៀងគ្នានេះ នៅពេលដែលទទួលរងនូវយុទ្ធសាស្ត្រដើរតួ ឬការក្លែងបន្លំបរិបទ។
Florian Tramèr អ្នកវិទ្យាសាស្ត្រកុំព្យូទ័រនៅ ETH Zürich បានកត់សម្គាល់ថា ខណៈពេលដែលបច្ចេកទេសការពារទំនើបបានធ្វើឱ្យគំរូឈានមុខគេមានភាពធន់នឹងការបញ្ចូលការណែនាំ (prompt injections) មូលដ្ឋាន ប៉ុន្តែធម្មជាតិជាមូលដ្ឋាននៃកំហុសនេះបង្ហាញថាវិធានការសុវត្ថិភាពបច្ចុប្បន្នប្រហែលជាមិនគ្រប់គ្រាន់សម្រាប់កម្មវិធីដែលមានហានិភ័យខ្ពស់នោះទេ។ នៅពេលដែល LLMs ត្រូវបានរួមបញ្ចូលកាន់តែខ្លាំងឡើងទៅក្នុងប្រព័ន្ធរដ្ឋាភិបាល យោធា និងប្រព័ន្ធថែទាំសុខភាព អ្នកស្រាវជ្រាវព្រមានថាអង្គការនានាគួរតែប្រតិបត្តិការក្រោមការសន្មតថាគំរូទាំងនេះមានភាពមិនមានសុវត្ថិភាពពីកំណើត។
ប្រភព៖ MIT Technology Review
មិនទាន់មានមតិយោបល់នៅឡើយទេ។ សូមធ្វើជាអ្នកដំបូងដែលចែករំលែកគំនិតរបស់អ្នក។