Moonshot AI компанияси сунъий интеллект моделлари хавфсизлигини текширмоқда
Хитойнинг сунъий интеллект ишлаб чиқарувчиси Moonshot компанияси ички текширув бошлади. Бунга Mindgard компанияси тадқиқотчилари Kimi’нинг икки машҳур модели хавфсизлик чекловларини айланиб ўтиши мумкинлигини аниқлагани сабаб бўлди.
Mindgard сунъий интеллект тизимларининг хавфсизлигини синовдан ўтказиш билан шуғулланади. Компания вакиллари BBC’га маълум қилишича, уларнинг мутахассислари июль ойида Kimi K2.6 ва K3 Swarm моделларида хавфсизлик чекловларини четлаб ўтиш имкониятини аниқлаган.
Ушбу заифлик «жэйлбрейк» деб аталадиган усул орқали аниқланган. Бунда тадқиқотчилар мураккаб кўрсатмалар кетма-кетлиги ёрдамида сунъий интеллектни ишлаб чиқувчилар томонидан ўрнатилган хавфсизлик чекловларини эътиборсиз қолдиришга ундашга ҳаракат қилади.
Mindgard маълумотига кўра, мазкур моделларнинг ҳимоя механизмлари потенциал хавфли мавзулар муҳокама қилинишига йўл қўймаслиги керак эди.
Компания тадқиқотчилари эса ушбу чекловларни айланиб ўтиб, моделлардан биологик қурол яратиш ва одам ўлдириш усуллари ҳақида маълумот олишга муваффақ бўлганини билдирган.
Moonshot ҳозирда мазкур ҳолат бўйича ички текширув ўтказмоқда.
