Tim Jetschool Academy · 3 Oktober 2026
Bulan September 2026 menjadi salah satu bulan paling padat dalam sejarah persaingan AI. Anthropic membuka duet dengan Claude Fable 5.1 pada 1 September, OpenAI menyusul dengan GPT-6 Astra pada 3 September, dan Google menutup babak dengan Gemini 4 Argon pada 30 September. Ketiganya mengklaim sebagai model terkuat di kelasnya, dan masing-masing membawa angka benchmark yang mengesankan—meski tidak semuanya bisa dibaca dengan cara yang sama.
Artikel ini merangkum perbandingan kemampuan ketiga model berdasarkan angka yang dipublikasikan pembuatnya serta penilaian lembaga benchmark independen seperti Artificial Analysis, Epoch AI, dan ARC Prize.
OpenAI menyebut GPT-6 Astra sebagai model paling cerdas yang pernah dibuatnya. Angka yang dipamerkan memang mencolok: 99,9 persen di ARC-AGI-3, benchmark penalaran abstrak yang sebelumnya belum pernah terjawab oleh model mana pun, serta 100 persen di ExploitBench untuk keamanan siber dan 97,6 persen di FrontierMath Tier 4, soal matematika tingkat riset. Konteksnya juga terbesar di kelasnya: 1,05 juta token.
Namun angka ARC-AGI-3 itu dicatat dengan harness milik OpenAI sendiri. Ketika ARC Prize menguji ulang dengan harness standar, skornya 62,7 persen—tetap yang tertinggi yang pernah terverifikasi, tapi jauh dari 99,9 persen. Penilaian independen pun terbelah: Epoch AI menempatkan Astra di posisi nomor satu dengan ECI score 167 saat dirilis, sementara Artificial Analysis memberi nilai 61, di bawah Claude Fable 5.1 yang 66.
Di benchmark lain hasilnya konsisten kuat: GPQA Diamond 96 persen, Terminal-Bench 4.0 (coding agentik) 57,9 persen, Terminal-Bench Science 64,6 persen, dan OSWorld 2.0 (penggunaan komputer) 72,6 persen. Harganya 10 dolar per juta token input dan 50 dolar untuk output—OpenAI berargumen biaya per tugas yang selesai justru lebih murah karena modelnya lebih efisien dalam penggunaan token.
Claude Fable 5.1, yang dirilis Anthropic dua hari sebelum Astra, justru memimpin Intelligence Index versi Artificial Analysis dengan skor 66—tertinggi dibanding pesaing mana pun. Anthropic menyebutnya model paling maju untuk coding dan pekerjaan pengetahuan.
Keunggulan terbesarnya ada di kerja agentik jangka panjang: Terminal-Bench 4.0 naik dari 42 menjadi 55,8 persen dibanding generasi sebelumnya, dan Terminal-Bench Science melonjak lebih dari dua kali lipat dari 24,7 menjadi 52,6 persen. SWE-bench Verified, benchmark perbaikan bug di repositori nyata, tembus 95 persen. Di Humanity's Last Exam dengan alat bantu, Fable 5.1 mencatat 65 persen, mengungguli Astra yang 57,2 persen.
Harganya sama dengan Astra—10 dolar per juta token input, 50 dolar output—tapi dengan diskon cache read 75 persen yang membuat sesi agen panjang jauh lebih ekonomis.
Gemini 4 Argon baru diumumkan 30 September dan belum tersedia untuk publik—Google membatasi aksesnya ke sekelompok pembela keamanan siber terpercaya lewat program Fairwind, sambil menjalani evaluasi keamanan bersama pemerintah AS. Tapi angka yang dilaporkan Google memaksa pesaing untuk menoleh: 77,9 persen di DeepSWE v1.1, benchmark software engineering repositori nyata, rekor baru yang mengungguli Astra (74,1 persen) maupun Fable 5.1 (67,4 persen).
Argon juga menyamai Astra dan Grok 4.7 di benchmark keamanan siber CWE-bench v1 dengan skor 68 persen, memimpin AutomationBench versi Zapier dengan 51,3 persen, serta—menurut CNBC—mengungguli Astra di Vals Index yang mengukur dampak ekonomi di sektor keuangan, hukum, dan pajak. Keunggulan lain ada di kapasitas output: hingga 1 juta token dalam satu trajektori, yang menurut Google memungkinkan penalaran jauh lebih dalam.
Yang paling menonjol justru harganya. Saat rilis publik nanti, Argon dihargai 2 dolar per juta token input dan 10 dolar output—sekitar seperlima harga Astra dan Fable 5.1—sebelum naik ke 4 dan 20 dolar setelah masa intro berakhir.
Ringkasan poin-poin kunci dari angka yang dipublikasikan:
Yang bisa disimpulkan dari gelombang rilisan ini: tidak ada satu model yang menyapu bersih. Setiap pembuat memilih benchmark tempat mereka unggul, dan lembaga penilai independen kerap memberi verdict berbeda dari klaim resmi—kasus Astra di ARC-AGI-3 dan Intelligence Index Artificial Analysis adalah contohnya. Bagi pengguna bisnis dan pengembang, pilihan terbaik tetap bergantung pada jenis pekerjaan: penalaran sains dan matematika condong ke Astra, coding agentik jangka panjang ke Fable 5.1, dan tugas software engineering berskala besar dengan anggaran ketat ke Gemini 4 Argon begitu tersedia luas.
Jelajahi program pelatihan bersertifikat dari Jetschool Academy.
Lihat Semua Program