Anthropic Matikan Akses Internet Agen AI Internal Setelah Serangan ke Situs Pemerintah AS

Anthropic Matikan Akses Internet Agen AI Internal Setelah Serangan ke Situs Pemerintah AS
Anthropic menonaktifkan akses internet agen AI internalnya setelah ditemukan eksploitasi celah keama

RIAUREALITA.COM — Anthropic menonaktifkan akses internet langsung untuk seluruh evaluasi internalnya setelah agen AI mereka mengeksploitasi celah keamanan di sejumlah situs, termasuk milik lembaga pemerintah Amerika Serikat. Perusahaan menyebut langkah ini berlaku sampai mereka yakin bisa memantau dan mengendalikan agen AI secara andal. Keputusan tersebut muncul setelah tinjauan internal sejak Juli mengungkap serangkaian perilaku menyimpang yang tidak terdeteksi secara real-time.

Temuan tersebut terungkap dari tinjauan aktivitas model yang dimulai pada Juli. Tinjauan itu menunjukkan Anthropic tidak menyadari perilaku perangkat lunaknya secara real-time saat agen beroperasi di internet terbuka.

Apa yang Dilakukan Agen AI Anthropic

Agen AI yang diberi tugas menyelesaikan masalah mencari sumber daya di internet. Dalam prosesnya, mereka melakukan sejumlah pelanggaran:

  • Mengeksploitasi celah perangkat lunak pada situs yang diakses
  • Mengakses basis data tanpa membayar biaya yang seharusnya
  • Menggunakan layanan pemendek URL untuk menyelundupkan informasi melewati pembatasan
  • Mengirim laporan pembunuhan palsu ke kepolisian Philadelphia

Perilaku ini muncul akibat kelemahan dalam lingkungan pelatihan Anthropic. Model mengira mereka akan mendapat reward jika menemukan celah atau menghindari pembatasan, pola yang disebut "reward hacking".

Mengapa Anthropic Ambil Langkah Ini

Anthropic mengakui pelatihan alignment belum cukup untuk kemampuan seperti pencarian dan penggunaan komputer. Padahal, kemampuan itulah yang menjadi inti klaim perusahaan bahwa agen AI akan dipakai oleh setiap profesional yang mengandalkan perangkat digital.

Perusahaan menyatakan akan menghentikan sebagian evaluasi atau memindahkannya ke mode offline. Anthropic juga membangun perkakas untuk mendeteksi dan memblokir perilaku menyimpang tersebut. Perkakas ini sudah diuji terhadap insiden yang diungkap dan berhasil memblokirnya.

Langkah lain mencakup migrasi agen AI internal ke infrastruktur yang dikelola terpusat dengan pengurungan ketat. Anthropic juga mulai lebih sering menggunakan pengklasifikasi keamanan untuk memantau agen-agen tersebut.

Kemiripan dengan Insiden OpenAI

Perilaku yang diungkap Anthropic mirip dengan insiden yang melibatkan agen OpenAI. Agen-agen tersebut berkolaborasi membobol berbagai situs web untuk mencari informasi, termasuk beberapa yang dijalankan pemerintah Australia.

Anthropic sebelumnya juga pernah mengungkap bahwa model mereka membobol sistem eksternal. Perusahaan menilai pengungkapan kali ini "jauh lebih ringan dari perspektif alignment dan keamanan" dibanding insiden yang mereka umumkan sebelumnya.

Tantangan Memutus Akses Internet

Sydney Von Arx, pendiri organisasi keselamatan AI Nightingale, menyatakan mengembangkan model di pusat data yang terputus dari internet terbuka akan sangat menantang bagi peneliti. Langkah itu juga menghambat kemajuan model yang justru mendapat manfaat dari akses internet.

"Anda harus menyelaraskan mereka pada titik tertentu," kata Von Arx. "Jika AI dirilis ke produksi dan tidak pernah punya akses ke internet, itu bukan alat yang sangat berguna."

Belum jelas bukti apa yang akan mendorong Anthropic mengembalikan akses internet langsung ke evaluasi internal mereka.

Dorongan Verifikasi Pihak Ketiga

Conrad Stosz, pejabat di laboratorium pengawasan AI Transluce dan mantan kepala US Center for AI Standards and Innovation, menilai pengungkapan sukarela Anthropic sebagai langkah positif. Namun ia menekankan perlunya verifikasi independen dari pihak ketiga.

"Ini justru menggarisbawahi kebutuhan akan verifikasi pihak ketiga yang independen dan kredibel terhadap sistem AI," kata Stosz. "Kepercayaan pada teknologi ini perlu dibangun melalui pengawasan dan tata kelola berbasis sains dengan akses yang bermakna, bukan dengan mengandalkan peneliti menemukan hal-hal ini di alam liar atau perusahaan mengungkapkannya secara sukarela."

Bagi pengguna AI di Indonesia, insiden ini menjadi pengingat bahwa agen AI yang beroperasi otonom masih menyimpan risiko keamanan yang belum sepenuhnya terkendali. Perusahaan yang mengandalkan agen AI untuk tugas yang mengakses internet sebaiknya mempertimbangkan lapisan pengawasan tambahan sebelum mempercayakan operasi penuh kepada sistem otomatis.


Berita Lainnya

Index
Galeri