AI Red Teaming
Definisi
AI Red Teaming adalah praktik pengujian keamanan sistem AI dengan mensimulasikan serangan, termasuk prompt injection, jailbreak, dan manipulasi model, untuk mengidentifikasi kerentanan sebelum dieksploitasi oleh aktor jahat.
Cara Kerja
Tim red team AI menggunakan berbagai teknik seperti adversarial prompting, jailbreaking, data poisoning, model inversion, dan membership inference. Proses ini dilakukan secara iteratif dengan dokumentasi temuan dan rekomendasi mitigasi.
Dampak & Relevansi
AI red teaming sangat penting seiring adopsi AI yang meluas. Microsoft, Google, dan OpenAI secara rutin melakukan red teaming pada model mereka, menemukan kerentanan kritis seperti prompt injection.
Istilah Terkait
Istilah lain dalam kategori huruf A: