Terkait topik iniDewan Teknologi Masa Depan & AI

Model Sonnet Baru Anthropic Hampir Setara Opus, tapi Memakai Lebih Banyak Token

  • Anthropic merilis Claude Sonnet 5.5, mengklaim bahwa model ini berjalan lebih dari 30% lebih cepat dibandingkan Sonnet 5.
  • Artificial Analysis menempatkannya di peringkat kedua pada Intelligence Index, hanya di bawah Opus 5,5.
  • Pada upaya maksimum, Sonnet 5.5 menggunakan sekitar 60% lebih banyak token output dibandingkan Opus 5.5.
Promo

Anthropic merilis Claude Sonnet 5.5 pada 28 September dengan harga yang sama seperti Sonnet 5. Perusahaan tersebut menyebut bahwa model ini berjalan lebih cepat 30% dan biaya per tugasnya hingga 30% lebih murah.

Sebuah perusahaan benchmarking independen menemukan hasil yang berbeda terkait biaya saat mereka menguji model ini hingga batas maksimalnya.

Ikuti kami di X untuk mendapatkan berita terbaru secara langsung

Disponsori
Disponsori

Model 5.5 Kedua dari Anthropic Hadir Beberapa Hari setelah Opus

Sonnet 5.5 adalah model kedua dalam keluarga Claude 5.5. Anthropic meluncurkan Opus 5.5 pada 22 September. Pada hari yang sama, OpenAI juga merilis GPT-6 Sol dan Luna.

Model baru ini tetap menggunakan harga Sonnet 5, yakni US$2 per satu juta token input dan US$10 per satu juta token output. Anthropic melaporkan skor 70,6% pada Terminal-Bench 4.0, yaitu tes coding agentic. Sonnet 5 hanya mencatat 10,3%, sedangkan Opus 5.5 mencapai 66,4%.

“Opus 5.5 dibuat untuk pekerjaan kompleks yang butuh penilaian cermat, namun Sonnet 5.5 paling unggul untuk tugas harian yang lebih terstruktur, memperbaiki bug, dan membuat dokumen, presentasi, serta spreadsheet yang rapi,” ujar tim tersebut.

Disponsori
Disponsori

Anthropic menyampaikan bahwa Sonnet 5.5 tidak memperluas batas kemampuannya. Oleh karena itu, ulasan alignment fokus pada risiko seperti menyesatkan pengguna dan membantu penyalahgunaan tingkat tinggi.

Sonnet 5.5 juga dilengkapi dengan perlindungan siber dan classifier anti-distillation. Sistem ini mencegah upaya mengekstrak penalaran model untuk melatih sistem pesaing. Claude Haiku 5.5 akan hadir dalam beberapa minggu mendatang.

Sementara itu, OpenAI menghentikan model terbarunya, GPT-6.1 Astra, karena alasan keamanan. CNBC mengonfirmasi pada hari Senin bahwa model tersebut tidak memenuhi standar perusahaan.

Artificial Analysis Temukan Konsumsi Token Lebih Tinggi saat Performa Maksimal

Artificial Analysis, perusahaan benchmarking yang menempatkan Grok 4.7 di posisi keempat, memberi nilai Sonnet 5.5 sebesar 56 pada Intelligence Index-nya. Skor ini membuatnya berada di peringkat kedua secara keseluruhan, hanya 2 poin di belakang Opus 5.5 saat dijalankan dengan usaha maksimal.

Perusahaan ini mencatat skor 64% untuk Sonnet 5.5 di Terminal-Bench 4.0, versus 60% untuk Opus 5.5 dan GPT-6 Astra. Dalam tes pekerjaan berbasis pengetahuan seperti GDPval-AA, mereka menemukan Sonnet 5.5 selevel dengan Opus 5.5.

Perusahaan tersebut menyatakan bahwa Sonnet 5.5 memakai jumlah token yang jauh lebih banyak untuk mencapai hasil tersebut.

“Pada level usaha maksimal, ketika performanya mendekati Opus 5.5, Claude Sonnet 5.5 menggunakan sekitar 193 ribu Output Token per tugas Intelligence Index,” terang posting-an itu.

Jumlah itu sekitar 60% lebih tinggi dibanding Opus 5.5 dan Sonnet 5 di usaha maksimal. Angka ini juga sekitar 7 kali lipat dari penggunaan token maksimal GPT-6 Astra.

Pelanggan early-access yang dikutip Anthropic justru melaporkan tren sebaliknya melawan Sonnet 5, meski pada tugas yang berbeda. Balyasny Asset Management melihat penggunaan token yang jauh lebih rendah pada tugas keuangan mereka.

“Pada suite privat kami berisi 2.441 tugas keuangan yang mencakup Q&A, ekstraksi, analisis, dan prediksi, Claude Sonnet 5.5 mencatat skor lebih tinggi dari Sonnet 5 dan menggunakan sekitar 121 ribu token per jawaban, sedangkan Sonnet 5 memakai 497 ribu,” jelas Joe Poirier, Senior AI Engineer di Balyasny Asset Management.

Artificial Analysis menguji versi pra-rilis yang membawa bug pada output terstruktur dan Anthropic sudah memperbaikinya. Perusahaan tersebut berencana melakukan evaluasi ulang dalam waktu dekat.

Langganan saluran YouTube kami untuk menyaksikan pemimpin serta jurnalis berbagi wawasan ahli

Penyangkalan

BeInCrypto berkomitmen pada pelaporan yang tidak bias dan transparan. Artikel berita ini bertujuan untuk menyajikan informasi yang akurat dan tepat waktu. Namun, pembaca disarankan untuk memverifikasi fakta secara independen dan berkonsultasi dengan profesional sebelum mengambil keputusan apa pun berdasarkan konten ini. Harap diperhatikan bahwa Syarat dan Ketentuan, Kebijakan Privasi, dan Disclaimer kami telah diperbarui.

Disponsori
Disponsori