Claude Sonnet 5 dibuat untuk menjadi model Soneta paling agen yang pernah ada. Ia dapat membuat rencana, menggunakan alat seperti browser dan terminal, dan berjalan secara mandiri pada tingkat yang, beberapa bulan lalu, memerlukan model yang lebih besar dan lebih mahal.
Bagi banyak pengembang, era AI agen dimulai dengan model kelas Soneta: Claude Sonnet 3.5, 3.6, dan 3.7 adalah model pertama yang menunjukkan keterampilan mengesankan dalam pengkodean dan penggunaan alat. Namun, baru-baru ini, peningkatan paling jelas dalam kemampuan agen terjadi pada model kelas Opus kami.
Soneta 5 mempersempit kesenjangan: kinerjanya mendekati Opus 4.8, tetapi dengan harga lebih rendah. Ini merupakan peningkatan substansial dibandingkan pendahulunya, Sonnet 4.6, dalam aspek penting kinerja agen seperti penalaran, penggunaan alat, pengkodean, dan kerja pengetahuan:
Penilaian keamanan kami menemukan bahwa Soneta 5 secara keseluruhan menunjukkan tingkat perilaku yang tidak diinginkan yang lebih rendah dibandingkan Soneta 4.6, dan secara umum lebih aman untuk digunakan dalam konteks agen. Evaluasi juga menunjukkan bahwa model ini memiliki kemampuan yang jauh lebih rendah dalam menjalankan tugas keamanan siber dibandingkan model Opus kami saat ini.
Mulai hari ini, Claude Sonnet 5 tersedia di semua paket: ini adalah model default untuk paket Gratis dan Pro, dan tersedia untuk pengguna Max, Tim, dan Perusahaan. Ini juga tersedia di Claude Code dan Platform Claude, yang diluncurkan dengan harga perkenalan $2 per juta token masukan dan $10 per juta token keluaran hingga 31 Agustus 2026, setelah itu akan diberi harga $3 per juta token masukan dan $15 per juta token keluaran. Pengembang dapat menggunakan claude-sonnet-5 melalui API Claude.
Bekerja dengan Claude Soneta 5
Bagan di bawah ini membandingkan kinerja Sonnet 5 dengan Sonnet 4.6 dan Opus 4.8 pada tingkat upaya yang berbeda pada evaluasi pencarian agen BrowserComp dan evaluasi penggunaan komputer OSWorld-Verified. Soneta 5 (garis oranye) merupakan peningkatan ketat dari Soneta 4.6 (garis abu-abu). Opus 4.8 (garis kuning) masih menjadi model pilihan untuk akurasi yang lebih tinggi dalam tugas-tugas ini, tetapi Sonnet 5 memberi pengembang opsi dengan harga lebih rendah dan kualitas yang jauh lebih tinggi daripada yang tersedia sebelumnya. Antara Sonnet 5 dan Opus 4.8, pengguna dapat menyesuaikan tingkat upaya untuk menemukan keseimbangan yang tepat antara biaya dan kinerja.
Masukan dari mitra akses awal kami konsisten: Sonnet 5 jauh lebih agen dibandingkan pendahulunya. Para penguji menjelaskan bagaimana Soneta menyelesaikan tugas-tugas rumit yang membuat model Sonnet sebelumnya tidak berfungsi lagi, bagaimana Soneta memeriksa keluarannya sendiri tanpa diminta secara eksplisit, dan bagaimana Sonnet melakukan semua pekerjaan agen ini dengan harga yang menarik:
Claude Sonnet 5 memberi agen kami lapisan eksekusi yang kuat untuk pekerjaan rekayasa perangkat lunak multi-langkah. Ini menangani pengkodean berkelanjutan, penggunaan alat, dan proses debug dengan baik dalam konteks teknis yang berantakan, dan sangat berguna untuk alur kerja yang memerlukan tindak lanjut dan landasan teknis.
Kami memberikan Claude Sonnet 5 tugas yang terdiri dari dua bagian—memperbarui tingkat akun Salesforce, mengirimkan pengumuman peluncuran ke kontak perusahaan—dan semuanya selesai secara menyeluruh. Itu biasanya terhenti di tengah jalan. Untuk otomatisasi sehari-hari, ini adalah hal yang mudah
Claude Sonnet 5 menyelesaikan lebih banyak hal dengan lebih sedikit. Kualitas keluaran sama, lebih sedikit langkah untuk mencapainya. Ia juga menolak permintaan tidak aman dengan bersih dan konsisten. Di Lovable, kami memberikan alat canggih ke tangan jutaan pembangun. Model yang mengetahui kapan harus mengatakan tidak sama pentingnya dengan model yang mengetahui cara membangunnya.
Kami menjalankan Claude Sonnet 5 terhadap lusinan permintaan penarikan nyata kami yang paling menantang, dan hal ini membawa masing-masing permintaan tersebut ke hasil yang teruji dan terverifikasi — membebaskan teknisi kami untuk fokus pada penilaian, keputusan, dan persetujuan akhir.
Saya meminta Claude Sonnet 5 untuk menyelidiki bug. Tanpa diminta, ia menulis pengujian reproduksi, menerapkan perbaikan, lalu menyembunyikannya untuk mengonfirmasi bahwa bug muncul kembali tanpa perubahan. Semuanya dalam sekali jalan.
Dengan Claude Sonnet 5, agen tetap mengikuti rencana, mengikuti konvensi kami, dan mengirimkan perubahan multi-langkah yang bersih, semuanya dengan biaya yang efisien.
Claude Sonnet 5 adalah yang terbaik dalam kode brownfield—kondisi balapan, tes tersembunyi, bagian yang tidak ingin disentuh oleh siapa pun. Ini menelusuri kegagalan hingga ke akar permasalahan sebenarnya dan memberikan perbaikan jangka panjang alih-alih menambal gejalanya.
Claude Sonnet 5 duduk di perbatasan Pareto untuk tugas hukum penggugat Eve. Kami melihat keuntungan paling jelas dalam penelitian dan analisis hukum, dengan rasio harga terhadap kinerja yang memudahkan pilihan untuk bermigrasi.
Agen ClickHouse mengeksplorasi data langsung dan menghasilkan wawasan dengan cepat, sehingga waktu untuk mendapatkan wawasan penting saat menguji model baru. Claude Sonnet 5 beralasan dalam langkah yang lebih ketat dan membuat pengguna kami menjawab lebih cepat. Kecepatan itulah yang dirasakan pelanggan kami.
Di Pace, agen penggunaan komputer kami menjalankan alur kerja asuransi—penerimaan pengiriman, FNOL, proses kerugian—pada sistem yang sudah digunakan oleh tim operasi kami. Claude Sonnet 5 secara konsisten mengambil tindakan yang tepat dan melakukannya dengan cepat, itulah yang dituntut oleh pekerjaan asuransi yang sebenarnya.
Evaluasi keselamatan
Evaluasi keselamatan pra-penerapan kami menemukan bahwa Sonnet 5 secara keseluruhan merupakan peningkatan dari Sonnet 4.6. Dalam hal keamanan agen, model ini lebih baik dalam menolak permintaan jahat dan menolak upaya pembajakan dalam serangan injeksi cepat. Model ini menunjukkan tingkat halusinasi dan penjilatan yang lebih rendah dibandingkan Sonnet 4.6. Pada audit perilaku otomatis kami, yang menguji berbagai perilaku tidak selaras seperti kerja sama dengan penyalahgunaan dan penipuan, Sonnet 5 mendapat skor lebih rendah (yaitu, lebih aman) secara keseluruhan. Namun, hal ini menunjukkan tingkat perilaku tidak selaras yang lebih tinggi dalam penilaian ini dibandingkan dengan Opus 4.8 dan Pratinjau Claude Mythos yang lebih mumpuni.

Kami tidak sengaja melatih Sonnet 5 tentang tugas keamanan siber. Ia dapat melakukan beberapa tugas cyber rutin yang tidak berbahaya, namun pada evaluasi yang menguji keterampilan cyber yang berpotensi berbahaya, seperti mengembangkan eksploitasi perangkat lunak, model ini menunjukkan kinerja yang jauh lebih buruk dibandingkan model seperti Opus 4.8 dan Mythos 5. Skor dari satu evaluasi, yang menguji kemampuan model untuk mengembangkan eksploitasi untuk kerentanan di browser Firefox, ditunjukkan pada tabel di bawah. Sonnet 5 tidak pernah mampu mengembangkan eksploitasi yang berfungsi penuh, namun menunjukkan tingkat yang sedikit lebih tinggi sebagian sukses dari Soneta 4.6. Perubahan terakhir ini kemungkinan besar disebabkan oleh peningkatan kecerdasan umum dibandingkan pelatihan khusus.

Karena Sonnet 5 lebih kuat dibandingkan pendahulunya dalam tugas ini, kami meluncurkannya dengan perlindungan cyber yang diaktifkan secara default. Perlindungan ini—yang mendeteksi dan memblokir penggunaan siber yang berbahaya secara real-time—sama dengan yang ada di Claude Opus 4.7 dan 4.8 (karena kami menilai bahwa tingkat risiko keamanan siber secara keseluruhan dari Sonnet 5 rendah, sehingga pengamanannya tidak seketat yang diluncurkan dengan Fable 5, yang memblokir tugas keamanan siber yang lebih luas).1
Penilaian lengkap kami terhadap Sonnet 5 di banyak evaluasi keselamatan dan kemampuan dilaporkan dalam Kartu Sistem Claude Sonnet 5.
Ketersediaan dan harga
Claude Sonnet 5 tersedia di mana saja saat ini dengan harga perkenalan $2 per juta token masukan dan $10 per juta token keluaran hingga 31 Agustus 2026. Kemudian beralih ke harga standar pada $3 per juta token masukan dan $15 per juta token keluaran.2 Kami telah meningkatkan batas tarif di Obrolan, Rekan Kerja, Kode Claude, dan Platform Claude3 untuk mengakomodasi penggunaan token yang lebih tinggi dengan tingkat upaya yang lebih tinggi; pengguna dapat memilih level mana yang masuk akal untuk proyek khusus mereka.









