Anthropic merilis Claude Sonnet 5.5 pada 28 September dengan harga yang sama seperti Sonnet 5. Perusahaan tersebut menyebut bahwa model ini berjalan lebih cepat 30% dan biaya per tugasnya hingga 30% lebih murah.
Sebuah perusahaan benchmarking independen menemukan hasil yang berbeda terkait biaya saat mereka menguji model ini hingga batas maksimalnya.
Ikuti kami di X untuk mendapatkan berita terbaru secara langsung
Model 5.5 Kedua dari Anthropic Hadir Beberapa Hari setelah Opus
Sonnet 5.5 adalah model kedua dalam keluarga Claude 5.5. Anthropic meluncurkan Opus 5.5 pada 22 September. Pada hari yang sama, OpenAI juga merilis GPT-6 Sol dan Luna.
Model baru ini tetap menggunakan harga Sonnet 5, yakni US$2 per satu juta token input dan US$10 per satu juta token output. Anthropic melaporkan skor 70,6% pada Terminal-Bench 4.0, yaitu tes coding agentic. Sonnet 5 hanya mencatat 10,3%, sedangkan Opus 5.5 mencapai 66,4%.
“Opus 5.5 dibuat untuk pekerjaan kompleks yang butuh penilaian cermat, namun Sonnet 5.5 paling unggul untuk tugas harian yang lebih terstruktur, memperbaiki bug, dan membuat dokumen, presentasi, serta spreadsheet yang rapi,” ujar tim tersebut.
Anthropic menyampaikan bahwa Sonnet 5.5 tidak memperluas batas kemampuannya. Oleh karena itu, ulasan alignment fokus pada risiko seperti menyesatkan pengguna dan membantu penyalahgunaan tingkat tinggi.
Sonnet 5.5 juga dilengkapi dengan perlindungan siber dan classifier anti-distillation. Sistem ini mencegah upaya mengekstrak penalaran model untuk melatih sistem pesaing. Claude Haiku 5.5 akan hadir dalam beberapa minggu mendatang.
Sementara itu, OpenAI menghentikan model terbarunya, GPT-6.1 Astra, karena alasan keamanan. CNBC mengonfirmasi pada hari Senin bahwa model tersebut tidak memenuhi standar perusahaan.
Artificial Analysis Temukan Konsumsi Token Lebih Tinggi saat Performa Maksimal
Artificial Analysis, perusahaan benchmarking yang menempatkan Grok 4.7 di posisi keempat, memberi nilai Sonnet 5.5 sebesar 56 pada Intelligence Index-nya. Skor ini membuatnya berada di peringkat kedua secara keseluruhan, hanya 2 poin di belakang Opus 5.5 saat dijalankan dengan usaha maksimal.
Perusahaan ini mencatat skor 64% untuk Sonnet 5.5 di Terminal-Bench 4.0, versus 60% untuk Opus 5.5 dan GPT-6 Astra. Dalam tes pekerjaan berbasis pengetahuan seperti GDPval-AA, mereka menemukan Sonnet 5.5 selevel dengan Opus 5.5.
Perusahaan tersebut menyatakan bahwa Sonnet 5.5 memakai jumlah token yang jauh lebih banyak untuk mencapai hasil tersebut.
“Pada level usaha maksimal, ketika performanya mendekati Opus 5.5, Claude Sonnet 5.5 menggunakan sekitar 193 ribu Output Token per tugas Intelligence Index,” terang posting-an itu.
Jumlah itu sekitar 60% lebih tinggi dibanding Opus 5.5 dan Sonnet 5 di usaha maksimal. Angka ini juga sekitar 7 kali lipat dari penggunaan token maksimal GPT-6 Astra.
Pelanggan early-access yang dikutip Anthropic justru melaporkan tren sebaliknya melawan Sonnet 5, meski pada tugas yang berbeda. Balyasny Asset Management melihat penggunaan token yang jauh lebih rendah pada tugas keuangan mereka.
“Pada suite privat kami berisi 2.441 tugas keuangan yang mencakup Q&A, ekstraksi, analisis, dan prediksi, Claude Sonnet 5.5 mencatat skor lebih tinggi dari Sonnet 5 dan menggunakan sekitar 121 ribu token per jawaban, sedangkan Sonnet 5 memakai 497 ribu,” jelas Joe Poirier, Senior AI Engineer di Balyasny Asset Management.
Artificial Analysis menguji versi pra-rilis yang membawa bug pada output terstruktur dan Anthropic sudah memperbaikinya. Perusahaan tersebut berencana melakukan evaluasi ulang dalam waktu dekat.
Langganan saluran YouTube kami untuk menyaksikan pemimpin serta jurnalis berbagi wawasan ahli









