Grok 4.5 Puncaki Uji Agent, Dukung Klaim Opus-Class Musk

  • Grok 4.5 memuncaki tolok ukur agent independen, mendukung klaim biaya Musk.
  • Model ini mencetak skor 51,4% pada AutomationBench-AA, dengan biaya termurah di antara pemimpin.
  • Namun, model tersebut juga mencatat 0,63 pelanggaran aturan per tugas, lebih banyak dibandingkan pesaing.
Promo

Elon Musk menyebut Grok 4.5 sebagai model kelas Opus yang berjalan lebih cepat dan biayanya lebih rendah. Sekarang, sudah ada tolok ukur independen dan agentic yang benar-benar mendukung klaim itu.

Pada AutomationBench-AA milik Artificial Analysis, Grok 4.5 menempati peringkat pertama dengan skor 51,4% dan biaya hanya US$0,34 per tugas. Model ini mengungguli Claude Fable 5 (48,6%) dan Claude Opus 4.8 (48,5%).

Skor AutomationBench-AA dari Model AI.
Skor AutomationBench-AA dari Model AI | Sumber: Artificial Analysis

Pengecekan Independen atas Klaim Elon Musk

SpaceXAI merilis Grok 4.5 secara publik minggu ini, yang dibangun di atas fondasi V9 dengan 1,5 triliun parameter. Presentasi Musk didasarkan pada evaluasi internal awal.

AutomationBench-AA mengubah situasi itu. Artificial Analysis menjalankan tolok ukur tersebut secara independen dan menjaga daftar tugasnya tetap privat agar tidak terjadi kontaminasi.

Disponsori
Disponsori

Uji coba ini mencakup 657 tugas di 40 aplikasi simulasi, termasuk Gmail, Slack, Salesforce, dan HubSpot. Tes ini menilai persentase target tugas yang berhasil diselesaikan oleh agent tanpa melanggar aturan.

Ikuti kami di X untuk dapatkan berita terbaru secara langsung

Grok 4.5: Lebih Murah, Lebih Cepat, dan Mayoritas Patuh

Biaya Grok 4.5 per tugas hanya US$0,34, jauh di bawah Fable 5 yang mencapai US$1,35 dan Opus 4.8 di US$1,46. Gemini 3.5 Flash yang paling mendekati, dengan biaya US$0,49.

Model ini menggunakan sekitar 8.000 token output per tugas, sekitar seperempat dari total token Opus 4.8. Efisiensi tersebut menjadi alasan utama perbedaan biaya, sejalan dengan pembingkaian yang digunakan Musk saat peluncuran.

“Total penggunaan token per tugas sebanyak 0,44 juta termasuk yang terendah di papan peringkat. Biaya rendah berasal dari efisiensi ini sekaligus harga token yang murah,” terang Artificial Analysis .

Selain itu, Grok 4.5 menyelesaikan 79,9% target tugas dan sepenuhnya lulus di 21,9% tugas. Untuk domain Keuangan, yang dianggap paling sulit, Grok 4.5 unggul dengan skor 71%, dibandingkan Fable 5 dengan 64% dan Opus 4.8 sebesar 62%.

Namun, model ini melanggar lebih banyak aturan dibandingkan pesaing terdekatnya. Grok 4.5 mencatat 0,63 pelanggaran guardrail per tugas, lebih banyak dibandingkan Opus 4.8 (0,55) dan Gemini 3.5 Flash (0,46).

Kesenjangan ini penting untuk perusahaan yang menerapkan agent di sistem keuangan sungguhan, karena satu pelanggaran saja bisa menimbulkan kerugian nyata.

Langganan channel YouTube kami untuk menonton pemimpin dan jurnalis membagikan wawasan ahli

Penyangkalan

BeInCrypto berkomitmen pada pelaporan yang tidak bias dan transparan. Artikel berita ini bertujuan untuk menyajikan informasi yang akurat dan tepat waktu. Namun, pembaca disarankan untuk memverifikasi fakta secara independen dan berkonsultasi dengan profesional sebelum mengambil keputusan apa pun berdasarkan konten ini. Harap diperhatikan bahwa Syarat dan Ketentuan, Kebijakan Privasi, dan Disclaimer kami telah diperbarui.

Disponsori
Disponsori