Mythos Kembali: Pengujian Anthropic Menunjukkan Fable 5 Bukan Satu-Satunya yang Berisiko Unik

  • Tes menunjukkan Opus 4,8, GPT-5,5, dan Kimi K2,7 dapat mengidentifikasi kerentanan yang sama.
  • Claude Fable 5 kembali hadir secara global, dengan lebih banyak perlindungan, 2 Juli.
  • Classifier baru Fable 5 menandai lebih banyak tugas coding dan debugging yang jinak.
Promo

Anthropic menyatakan pengujian internal menemukan Claude Fable 5 tidak menimbulkan bahaya siber yang unik, sementara Claude Mythos 5 akan hadir kembali secara global pada 2 Juli.

Pernyataan ini disampaikan bersamaan dengan peluncuran ulang Fable 5 secara global, yang mengakhiri penangguhan selama 18 hari akibat kontrol ekspor AS pada 12 Juni lalu. Anthropic melakukan pengujian pada model-model pesaing guna mengetahui ancaman nyata di balik pembatasan tersebut.

Disponsori
Disponsori

Mengapa Anthropic Menangguhkan Fable 5

Fable 5 dan Mythos 5 meluncur pada 9 Juni, keduanya menggunakan inti model yang sama, dengan Fable 5 terbuka untuk publik. Sementara, Mythos 5 hanya tersedia bagi sejumlah kecil mitra terpercaya Project Glasswing untuk tugas pertahanan siber.

Kontrol ekspor diberlakukan setelah peneliti Amazon menemukan metode untuk melewati sistem keamanan Fable 5. Teknik ini membuat model tersebut mampu mengidentifikasi celah perangkat lunak dan, pada satu kasus, memperagakan eksploitasi celah tersebut.

Pengujian Anthropic menemukan bahwa Claude Opus 4.8, GPT-5.5, dan Kimi K2.7 juga mampu mendeteksi kerentanan yang sama seperti yang diungkap dalam laporan Amazon terhadap Fable 5. Setiap model yang diuji pun dapat mereplikasi demonstrasi eksploitasi tersebut.

Hasil ini menunjukkan bahwa arahan tersebut menargetkan celah yang umum di industri, bukan ancaman spesifik dari Fable 5. Meski begitu, Anthropic tetap mengembangkan classifier yang lebih kuat untuk memblokir teknik tersebut, yang kini juga menandai permintaan pengkodean dan debugging rutin.

Bagaimana Guardrails Bekerja Sebenarnya

Fable 5 hadir dengan margin keamanan terkuat yang pernah Anthropic tanamkan di model manapun. Classifier-nya memblokir permintaan yang terlihat sedikit berisiko, bukan hanya yang jelas berbahaya. Classifier baru yang dilatih setelah laporan Amazon memblokir teknik bypass yang dilaporkan pada lebih dari 99% kasus, menurut Anthropic. Permintaan yang diblokir kini otomatis dialihkan ke Opus 4.8.

Margin keamanan ini memang ada harganya. Anthropic mengakui classifier ini juga menandai lebih banyak permintaan pengkodean dan debugging yang tidak berbahaya, dan mengatakan akan terus melakukan penyesuaian supaya jumlah false positive makin berkurang. Mythos 5, yang memiliki lebih sedikit guardrails, hanya kembali tersedia untuk institusi pemilik Mythos 5 yang telah mendapat izin dari pemerintah pada 26 Juni.

Data internal Anthropic menimbulkan pertanyaan yang lebih sulit. Jika model yang lebih lemah sudah bisa melakukan hal yang menyebabkan Fable 5 dilarang, standar apa yang akan regulator terapkan saat model terdepan berikutnya diluncurkan?


Untuk membaca analisis pasar kripto terbaru dari BeInCrypto, klik di sini.

Penyangkalan

Seluruh informasi yang terkandung dalam situs kami dipublikasikan dengan niat baik dan bertujuan memberikan informasi umum semata. Tindakan apa pun yang dilakukan oleh para pembaca atas informasi dari situs kami merupakan tanggung jawab mereka pribadi. Selain itu, sebagian artikel di situs ini merupakan hasil terjemahan AI dari versi asli BeInCrypto yang berbahasa Inggris.

Disponsori
Disponsori