Anthropic menyatakan pengujian internal menemukan Claude Fable 5 tidak menimbulkan bahaya siber yang unik, sementara Claude Mythos 5 akan hadir kembali secara global pada 2 Juli.
Pernyataan ini disampaikan bersamaan dengan peluncuran ulang Fable 5 secara global, yang mengakhiri penangguhan selama 18 hari akibat kontrol ekspor AS pada 12 Juni lalu. Anthropic melakukan pengujian pada model-model pesaing guna mengetahui ancaman nyata di balik pembatasan tersebut.
Mengapa Anthropic Menangguhkan Fable 5
Fable 5 dan Mythos 5 meluncur pada 9 Juni, keduanya menggunakan inti model yang sama, dengan Fable 5 terbuka untuk publik. Sementara, Mythos 5 hanya tersedia bagi sejumlah kecil mitra terpercaya Project Glasswing untuk tugas pertahanan siber.
Kontrol ekspor diberlakukan setelah peneliti Amazon menemukan metode untuk melewati sistem keamanan Fable 5. Teknik ini membuat model tersebut mampu mengidentifikasi celah perangkat lunak dan, pada satu kasus, memperagakan eksploitasi celah tersebut.
Pengujian Anthropic menemukan bahwa Claude Opus 4.8, GPT-5.5, dan Kimi K2.7 juga mampu mendeteksi kerentanan yang sama seperti yang diungkap dalam laporan Amazon terhadap Fable 5. Setiap model yang diuji pun dapat mereplikasi demonstrasi eksploitasi tersebut.
Hasil ini menunjukkan bahwa arahan tersebut menargetkan celah yang umum di industri, bukan ancaman spesifik dari Fable 5. Meski begitu, Anthropic tetap mengembangkan classifier yang lebih kuat untuk memblokir teknik tersebut, yang kini juga menandai permintaan pengkodean dan debugging rutin.
Bagaimana Guardrails Bekerja Sebenarnya
Fable 5 hadir dengan margin keamanan terkuat yang pernah Anthropic tanamkan di model manapun. Classifier-nya memblokir permintaan yang terlihat sedikit berisiko, bukan hanya yang jelas berbahaya. Classifier baru yang dilatih setelah laporan Amazon memblokir teknik bypass yang dilaporkan pada lebih dari 99% kasus, menurut Anthropic. Permintaan yang diblokir kini otomatis dialihkan ke Opus 4.8.
Margin keamanan ini memang ada harganya. Anthropic mengakui classifier ini juga menandai lebih banyak permintaan pengkodean dan debugging yang tidak berbahaya, dan mengatakan akan terus melakukan penyesuaian supaya jumlah false positive makin berkurang. Mythos 5, yang memiliki lebih sedikit guardrails, hanya kembali tersedia untuk institusi pemilik Mythos 5 yang telah mendapat izin dari pemerintah pada 26 Juni.
Data internal Anthropic menimbulkan pertanyaan yang lebih sulit. Jika model yang lebih lemah sudah bisa melakukan hal yang menyebabkan Fable 5 dilarang, standar apa yang akan regulator terapkan saat model terdepan berikutnya diluncurkan?









