Google Baru Rilis Model Audio Paling Canggih. Ini Peringkatnya

  • Model suara baru Google menempati peringkat teratas pada indeks ucapan Artificial Analysis dengan skor 82,6.
  • Gemini 3.8 Live dikenakan biaya 84 sen per jam, yaitu model audio termurah dalam indeks tersebut.
  • Penguji manusia dalam tes suara buta masih lebih menyukai Gemini 3.1 Flash Live yang lebih lama.
Promo

Google meluncurkan Gemini 3.8 Live dan Gemini 3.8 Live Extended Thinking pada 15 September dan menyebutnya sebagai model audio paling canggih buatan mereka sejauh ini.

Kedua model ini dapat berbicara, melakukan penalaran, dan menangani berbagai tugas. Namun bagaimana penilaian analis independen terhadapnya? Versi Extended Thinking berhasil meraih peringkat teratas di Speech-to-Speech Index milik Artificial Analysis dengan skor 82,6, mengungguli GPT-Live-1 dan Grok Voice.

Ikuti kami di X untuk mendapatkan berita terbaru secara real-time

Bagaimana Benchmark Memberi Peringkat pada Model AI Percakapan Terbaru Google

Speech-to-Speech Index milik Artificial Analysis mengambil rata-rata dari aspek penalaran ucapan, performa agentic, preferensi arena, dan tingkat keberhasilan tugas.

Disponsori
Disponsori

Gemini 3.8 Live Extended Thinking, yang diuji dengan tingkat penalaran tinggi, langsung menempati posisi pertama. GPT-Live-1 Astra berada di posisi berikutnya dengan skor 81,5 dan Grok Voice Think Fast 2.0 High mencatat skor 81,3.

Peringkat Gemini 3.8 Live di Speech-to-Speech Index
Peringkat Gemini 3.8 Live di Speech-to-Speech Index | Sumber: Artificial Analysis

Gemini 3.8 Live versi standar menempati posisi kelima dengan skor 76,0. Kedua varian tersebut berhasil mengungguli Gemini 3.1 Flash Live High yang hanya meraih skor 71,5.

Perbedaan agentic makin besar. Extended Thinking memperoleh skor 68,6% pada benchmark Tau Voice, jauh di atas generasi sebelumnya yang hanya 37,7%.

Pada benchmark penalaran ucapan, Extended Thinking mencatat skor 97,7%, sedikit lebih unggul dibanding Grok Voice di 97,2%. namun, skor ini masih di bawah Qwen Audio 3.0 Realtime Plus yang meraih 99,2%.

Penguji Manusia Masih Memilih Model Gemini yang Lebih Lama

Sisi harga menampilkan perbedaan signifikan. Model standar dihargai US$0,84 per jam input audio. Nilai tersebut sekitar separuh dari pendahulunya yang mencapai US$1,75 dan merupakan tarif termurah di Index.

Untuk Extended Thinking, biayanya US$3,50 per jam. Nominal ini lebih rendah dibanding GPT-Live-1 Sol di US$4,47 dan Grok Voice Think Fast 2.0 High di US$4,80.

Latensi juga turun. Waktu rata-rata sampai audio pertama kini hanya 1,18 detik, jauh lebih cepat dibanding model Gemini lama yang butuh 2,99 detik.

Walau begitu, para pendengar masih belum sepenuhnya yakin. Gemini 3.1 Flash Live tetap menjadi pilihan utama dalam arena percakapan Speech Agent Arena blind, dengan skor Elo 1096.

Gemini 3.8 Live menempati posisi kedua dengan skor 1083. Sementara, varian Extended Thinking berada di posisi 990, walaupun berhasil menyelesaikan 89,1% tugasnya.

Sekarang, Voice AI dinilai berdasarkan dua aspek dengan arah berbeda. Benchmark memberikan penghargaan pada model yang memiliki penalaran lebih keras. Sedangkan preferensi diberikan pada model yang paling baik dalam berbicara. Google saat ini memimpin keduanya, namun dengan model berbeda.

Subscribe ke YouTube kami untuk menyaksikan para pemimpin dan jurnalis memberikan wawasan ahli

Penyangkalan

BeInCrypto berkomitmen pada pelaporan yang tidak bias dan transparan. Artikel berita ini bertujuan untuk menyajikan informasi yang akurat dan tepat waktu. Namun, pembaca disarankan untuk memverifikasi fakta secara independen dan berkonsultasi dengan profesional sebelum mengambil keputusan apa pun berdasarkan konten ini. Harap diperhatikan bahwa Syarat dan Ketentuan, Kebijakan Privasi, dan Disclaimer kami telah diperbarui.

Disponsori
Disponsori