Google meluncurkan Gemini 3.8 Live dan Gemini 3.8 Live Extended Thinking pada 15 September dan menyebutnya sebagai model audio paling canggih buatan mereka sejauh ini.
Kedua model ini dapat berbicara, melakukan penalaran, dan menangani berbagai tugas. Namun bagaimana penilaian analis independen terhadapnya? Versi Extended Thinking berhasil meraih peringkat teratas di Speech-to-Speech Index milik Artificial Analysis dengan skor 82,6, mengungguli GPT-Live-1 dan Grok Voice.
Ikuti kami di X untuk mendapatkan berita terbaru secara real-time
Bagaimana Benchmark Memberi Peringkat pada Model AI Percakapan Terbaru Google
Speech-to-Speech Index milik Artificial Analysis mengambil rata-rata dari aspek penalaran ucapan, performa agentic, preferensi arena, dan tingkat keberhasilan tugas.
Gemini 3.8 Live Extended Thinking, yang diuji dengan tingkat penalaran tinggi, langsung menempati posisi pertama. GPT-Live-1 Astra berada di posisi berikutnya dengan skor 81,5 dan Grok Voice Think Fast 2.0 High mencatat skor 81,3.
Gemini 3.8 Live versi standar menempati posisi kelima dengan skor 76,0. Kedua varian tersebut berhasil mengungguli Gemini 3.1 Flash Live High yang hanya meraih skor 71,5.
Perbedaan agentic makin besar. Extended Thinking memperoleh skor 68,6% pada benchmark Tau Voice, jauh di atas generasi sebelumnya yang hanya 37,7%.
Pada benchmark penalaran ucapan, Extended Thinking mencatat skor 97,7%, sedikit lebih unggul dibanding Grok Voice di 97,2%. namun, skor ini masih di bawah Qwen Audio 3.0 Realtime Plus yang meraih 99,2%.
Penguji Manusia Masih Memilih Model Gemini yang Lebih Lama
Sisi harga menampilkan perbedaan signifikan. Model standar dihargai US$0,84 per jam input audio. Nilai tersebut sekitar separuh dari pendahulunya yang mencapai US$1,75 dan merupakan tarif termurah di Index.
Untuk Extended Thinking, biayanya US$3,50 per jam. Nominal ini lebih rendah dibanding GPT-Live-1 Sol di US$4,47 dan Grok Voice Think Fast 2.0 High di US$4,80.
Latensi juga turun. Waktu rata-rata sampai audio pertama kini hanya 1,18 detik, jauh lebih cepat dibanding model Gemini lama yang butuh 2,99 detik.
Walau begitu, para pendengar masih belum sepenuhnya yakin. Gemini 3.1 Flash Live tetap menjadi pilihan utama dalam arena percakapan Speech Agent Arena blind, dengan skor Elo 1096.
Gemini 3.8 Live menempati posisi kedua dengan skor 1083. Sementara, varian Extended Thinking berada di posisi 990, walaupun berhasil menyelesaikan 89,1% tugasnya.
Sekarang, Voice AI dinilai berdasarkan dua aspek dengan arah berbeda. Benchmark memberikan penghargaan pada model yang memiliki penalaran lebih keras. Sedangkan preferensi diberikan pada model yang paling baik dalam berbicara. Google saat ini memimpin keduanya, namun dengan model berbeda.
Subscribe ke YouTube kami untuk menyaksikan para pemimpin dan jurnalis memberikan wawasan ahli









