Apakah Anda Masih Harus Meninjau Kode AI Anda?
Agen Anda menulis kode yang lebih baik daripada setengah permintaan tarik yang biasa Anda gabungkan. Jadi, apakah Anda masih membaca setiap baris? Kasus jujur untuk kedua sisi, 10 sinyal yang memberi tahu Anda bahwa agen melakukan kesalahan, dan seberapa banyak tinjauan yang sebenarnya layak untuk setiap perubahan.
Argumen dimulai dengan cara yang sama di setiap tim. Satu sisi mengatakan bahwa agen sekarang mengirimkan kode yang lebih bersih daripada setengah permintaan tarik yang biasa kita setujui, jadi mengapa kita masih membaca setiap baris? Sisi lainnya mengatakan karena kita adalah orang yang menandatangani.
Kedua sisi benar. Itulah mengapa argumen ini tidak pernah berakhir. Ini tidak berakhir karena pertanyaannya salah, dan setelah Anda memperbaiki pertanyaannya, jawabannya menjadi hampir membosankan.
Kasus untuk mengirim tanpa membaca setiap baris
Mulailah dengan versi terkuat dari argumen optimis, karena ini lebih kuat daripada yang diakui sebagian besar peninjau.
Pada tugas yang terfokus dengan spesifikasi yang jelas dan rangkaian pengujian, agen pengkodean modern menghasilkan kode yang lebih konsisten daripada manusia median yang bekerja di bawah tenggat waktu. Ia tidak merasa bosan di jalur kesalahan. Ia menulis pemeriksaan null pada pukul 6 sore di hari Jumat. Ia mengikuti konvensi proyek yang diberikan, setiap kali, tanpa pemberontakan kecil yang diam yang diizinkan oleh pengembang yang lelah.
Tinjauan manusia juga sudah rusak sebelum agen tiba. Siapa pun yang telah bekerja di tim nyata tahu refleks LGTM: perhatian peninjau runtuh setelah beberapa ratus baris, dan persetujuan yang mengikuti adalah sosial, bukan teknis. Kita tidak kehilangan era keemasan tinjauan yang ketat. Kita kehilangan ritual yang sudah sebagian besar merupakan teater.
Kemudian ada volume. Satu pengembang yang menjalankan lima agen secara paralel menghasilkan lebih banyak perbedaan per jam daripada yang bisa dibaca dengan hati-hati oleh manusia mana pun. Jika aturan Anda adalah "baca semuanya", Anda telah secara diam-diam menginstal ulang diri Anda sebagai bottleneck yang baru saja Anda otomatisasi. Seorang manusia yang menelusuri perbedaan 900 baris menghasilkan tanda tangan tanpa menghasilkan pengetahuan, dan itu lebih buruk daripada tidak meninjau sama sekali, karena itu menciptakan jaminan di mana tidak ada.
Kasus untuk menjaga manusia di perbedaan
Sekarang sisi lainnya, yang juga lebih kuat daripada yang diakui para penggemar.
Akuntabilitas tidak berpindah. Model tidak akan dipanggil pada pukul 3 pagi. Ia tidak ada dalam tinjauan insiden, ia tidak berbicara dengan pelanggan yang datanya bocor, dan ia tidak membawa konsekuensi dari perubahan ke kuartal berikutnya. Siapa pun yang menggabungkan memiliki hasilnya, dan meninjau adalah cara kepemilikan dijalankan daripada hanya dinyatakan.
Peninjau agen gagal dalam arah yang sama seperti penulis agen. Ini adalah argumen yang sebenarnya menyelesaikan proposal "biarkan agen lain meninjaunya". Dua agen dari keluarga model yang sama, diberikan konteks yang sama, berbagi prior, berbagi data pelatihan dan berbagi titik buta. Kesalahan mereka berkorelasi. Seorang agen kedua dengan senang hati akan menangkap pengujian yang hilang atau kesalahan yang tidak ditangani, dan akan dengan senang hati menyetujui kesalahpahaman halus tentang domain Anda yang menghasilkan bug di tempat pertama, karena ia membuat kesalahpahaman yang sama. Dua peninjau yang salah dalam arah yang sama tidak menjumlahkan menjadi sebuah tinjauan.
Pengukuran juga tidak menguntungkan. Data industri menunjukkan bahwa peninjau bertukar lebih banyak putaran secara berarti pada perubahan yang dihasilkan AI daripada pada yang ditulis manusia: kode datang lebih cepat dan memerlukan waktu lebih lama untuk menjadi dapat dipercaya. Sebuah studi Januari 2026 lebih jauh dan menemukan bahwa perubahan yang dihasilkan agen membawa lebih banyak redundansi dan lebih banyak utang teknis yang terakumulasi per perubahan daripada yang ditulis manusia, sementara peninjau melaporkan merasa lebih baik tentang menyetujuinya. Jarak itu, antara seberapa baik kode terasa dan seberapa baik itu, adalah seluruh risiko dalam satu kalimat.
Perdebatan diframing dengan salah
Berikut adalah reframing yang mengakhiri pertemuan.
Anda tidak meninjau kode karena Anda tidak mempercayai penulisnya. Anda meninjaunya karena Anda adalah orang yang menandatangani. Itu adalah dua aktivitas yang sama sekali berbeda, dan seluruh argumen berasal dari kebingungan antara keduanya.
Setelah Anda melihatnya dengan cara itu, "apakah agen lebih baik daripada manusia" berhenti menjadi pertanyaan penentu. Pertanyaan penentu adalah: jika perubahan ini salah, seberapa mahal untuk mengetahuinya, dan seberapa mahal untuk membatalkannya? Sebuah kesalahan ketik dalam judul pemasaran ditemukan dalam hitungan detik dan dibatalkan dalam hitungan detik. Sebuah pemeriksaan izin yang terbalik dalam middleware otorisasi ditemukan oleh pelanggan, atau oleh regulator, dan itu tidak pernah benar-benar dibatalkan, karena pada saat itu data sudah dibaca.
Jadi jawabannya bukan "tinjau semuanya" atau "percayai agen". Ini adalah:
Anda berhenti meninjau baris. Anda mulai meninjau risiko.
Secara konkret, tinjauan berpindah dari tengah pekerjaan ke dua batasnya. Sebelumnya: baca rencana, karena rencana yang salah dieksekusi dengan sempurna adalah mode kegagalan yang paling mahal, dan sebuah rencana terdiri dari lima belas baris alih-alih sembilan ratus. Setelah: baca perbedaan sebanding dengan radius ledakan. Di antara, baris-barisan tersebut milik mesin.
Apa yang sebenarnya terjadi ketika "agen membuat kesalahan"
Hal yang paling berguna yang dapat Anda bawa kembali ke tim Anda bukanlah opini, tetapi daftar tanda objektif. Bukan "kode terasa tidak tepat", tetapi sinyal yang dapat Anda periksa pada perbedaan dalam waktu kurang dari satu menit. Ini adalah yang telah mendapatkan tempatnya.
- Pengujian berubah dalam komit yang sama dengan kode yang mereka tutup. Hijau dibangun, bukan diamati. Ini adalah tanda sinyal tertinggi dalam daftar, dan ini adalah yang harus diperiksa terlebih dahulu.
- Sebuah pernyataan dilemahkan atau pengujian dinonaktifkan. Sebuah
skip, sebuahonly, sebuah pernyataan yang diperluas untuk menerima apa yang dikembalikan oleh kode baru, sebuahtry/catchyang menelan kesalahan yang seharusnya diungkapkan oleh pengujian. - Perbedaan lebih besar dari tugas. Berkas yang tidak diminta telah disentuh. Creep lingkup dalam agen bukanlah antusiasme, itu adalah tanda bahwa agen menafsirkan tujuan di suatu tempat di sepanjang jalan.
- Permukaan yang diciptakan. Metode API, opsi konfigurasi atau jalur yang tidak ada. Itu dikompilasi dalam kepala agen dan tidak di tempat lain.
- Lingkungan diperbaiki alih-alih kode. Jalur absolut yang dikodekan keras, nilai spesifik mesin, token pribadi, nama pengguna. Gejala menghilang di mesin agen dan berpindah ke mesin orang lain.
- Ketergantungan muncul tanpa diminta. Rantai pasokan baru, lisensi baru, permukaan pemeliharaan baru, diputuskan oleh sesuatu yang tidak akan memeliharanya.
- Duplikasi alih-alih penggunaan kembali. Itu mengimplementasikan pembantu yang sudah ada dua puluh baris sebelumnya. Ini adalah mekanisme di balik utang yang terukur: setiap perubahan terlihat secara lokal wajar dan basis kode dengan tenang mendapatkan cara ketiga untuk melakukan hal yang sama.
- Ringkasan tidak cocok dengan perbedaan. "Diperbaiki dan diuji" ketika tidak ada pengujian yang dijalankan. Narasi dihasilkan dengan kepercayaan yang sama terlepas dari apakah pekerjaan itu terjadi atau tidak, jadi anggap itu sebagai klaim untuk diverifikasi, jangan pernah sebagai laporan.
- Instruksi berhenti diikuti. Konvensi kecil yang diam-diam diabaikan adalah bagaimana sesi menurun sebelum mulai berhalusinasi secara langsung. Jika Anda menggunakan canary di file konteks Anda, ini adalah tepatnya apa yang ada di sana untuk menangkap.
- Tanah sensitif disentuh secara kebetulan. Sebuah pembacaan
.env, panggilan jaringan keluar baru, baris log baru yang membawa data pengguna, migrasi yang dibundel ke dalam komit fitur.
Perhatikan apa yang tidak ada dalam daftar: gaya, penamaan, format, "saya akan melakukannya dengan cara yang berbeda". Itu selalu menjadi bagian terlemah dari tinjauan manusia dan sekarang benar-benar menjadi pemborosan bagi manusia. Hapus mereka dari tinjauan Anda dan Anda mendapatkan kembali perhatian yang Anda butuhkan untuk sepuluh item di atas.
Seberapa banyak tinjauan yang layak diterima oleh sebuah perubahan?
Radius ledakan, bukan ukuran perbedaan, yang memutuskan. Tabel yang dapat diadopsi tim Anda sore ini:
| Jenis perubahan | Tingkat tinjauan |
|---|---|
| Teks, CSS, dokumen, alat terisolasi | Telusuri perbedaan, kirim |
| Fitur di balik bendera, pengujian hijau | Baca rencana dan ringkasan perbedaan |
| Modul bersama, refactor antar berkas | Baca setiap baris yang melintasi batas |
| Otorisasi, pembayaran, izin, data pribadi | Baris demi baris, oleh manusia, tanpa pengecualian |
| Migrasi, jalur penghapusan, infrastruktur | Baris demi baris, sepasang mata kedua, rencana rollback |
Ukuran perbedaan memberi tahu Anda berapa lama tinjauan berlangsung. Radius ledakan memberi tahu Anda apakah itu opsional.
Baris-baris tersebut bukan tentang tingkat kepercayaan. Mereka tentang biaya menjadi salah, yang merupakan sifat dari kode dan bukan dari siapa yang menulisnya. Itulah yang membuat tabel ini dapat digunakan: tidak ada yang perlu setuju tentang seberapa baik agen-agen tersebut agar setuju pada tabel tersebut. Jika tim Anda terjebak pada pertanyaan filosofis, lewati itu dan negosiasikan barisnya sebagai gantinya. Anda akan terkejut betapa cepatnya itu menyatu.
Jika produk Anda menangani data pribadi di Eropa, satu baris lagi ditulis untuk Anda oleh hukum daripada oleh selera: apa yang harus dihormati oleh fitur yang dibangun AI di bawah GDPR bukanlah panggilan penilaian, dan "seorang agen menulisnya" tidak pernah menjadi pembelaan.
Apa yang berubah ketika lima agen berjalan sekaligus
Semua yang di atas mengasumsikan Anda dapat melihat perubahan tersebut. Dengan agen paralel, asumsi itu pertama kali rusak, dan itu rusak dengan cara tertentu: perbedaan berhenti memiliki satu penulis. Tiga agen telah menyentuh pohon kerja sejak komit terakhir Anda, dan pertanyaan "siapa yang mengubah berkas ini, dan sebagai bagian dari tugas mana" tidak lagi memiliki jawaban yang jelas. Tinjauan tanpa atribusi bukanlah tinjauan, itu adalah arkeologi.
Itu adalah masalah alat, dan itu adalah alasan AgentsRoom menempatkan tinjauan di tempat agen berada daripada di akhir permintaan tarik:
- Review Mode menunjukkan setiap perubahan yang dibuat agen Anda, sebagai perbedaan yang dapat dibaca, sebelum apa pun dikomit. Ini adalah langkah "baca perbedaan sebanding dengan radius ledakan", dibuat cukup murah sehingga orang benar-benar melakukannya.
- Tinjauan per-agen menyaring perbedaan itu berdasarkan agen dan memungkinkan Anda mengkomit pekerjaan setiap agen secara terpisah. Lima agen paralel menjadi lima unit yang dapat ditinjau alih-alih satu pohon kerja yang tidak dapat dibaca, dan perubahan buruk tetap dapat diatribusikan kepada tugas yang memproduksinya.
- Pesan komit dihasilkan dari perbedaan yang nyata dengan tombol sparkle di bidang komit, sehingga riwayat menggambarkan apa yang berubah daripada apa yang dikatakan agen itu sedang dilakukan. Perbedaan itu penting pada pukul 3 pagi, enam bulan kemudian.
Tidak ada dari ini menggantikan penilaian. Ini menghilangkan alasan untuk tidak menjalankannya.
Buat mesin memiliki baris
Jika Anda ingin berhenti membaca baris, sesuatu yang lain harus membacanya. Dalam praktiknya, empat hal memikul beban itu:
Pengujian yang tidak ditulis agen dalam napas yang sama dengan kode. Ditulis terlebih dahulu, atau ditulis oleh agen yang berbeda, atau setidaknya ditinjau sebagai perubahan mereka sendiri. Begitu kode dan pengujiannya berasal dari generasi yang sama, mereka berhenti menjadi bukti independen.
Seorang peninjau dengan model yang berbeda. Ini adalah jawaban praktis untuk masalah kegagalan yang berkorelasi. Jika agen kedua meninjau, jalankan di penyedia atau keluarga model yang berbeda dari penulis. Anda tidak akan sepenuhnya menghilangkan kesalahan, tetapi peninjau dari keluarga Codex pada kode yang ditulis Claude menangkap kelas masalah yang terukur berbeda daripada peninjau dari model yang sama, tepat karena ia tidak berbagi prior penulis.
Gerbang yang tidak merasa lelah. Tipe, lint, pemindaian rahasia, lantai cakupan, CI yang menolak migrasi yang dibundel dengan fitur. Setiap aturan yang dapat Anda ungkapkan sebagai gerbang adalah aturan yang tidak perlu Anda perhatikan lagi.
Sebuah loop yang menutup pada dirinya sendiri. Seorang agen yang membangun, menjalankan pekerjaannya sendiri sesuai rencana dan beriterasi sebelum menyerahkan apa pun menghilangkan seluruh kategori "tidak pernah dijalankan" dari tinjauan Anda. Itu adalah loop agen yang memperbaiki diri, dan itu adalah perbedaan antara agen yang menghasilkan perbedaan dan yang menghasilkan hasil. Itu tidak menjawab pertanyaan apakah manusia harus menandatangani. Itu hanya berarti manusia menandatangani sesuatu yang sudah berfungsi.
Jadi, apakah Anda masih meninjau?
Ya, dan lebih sedikit daripada yang Anda lakukan hari ini.
Berhenti membaca baris untuk merasa bertanggung jawab. Baca rencana sebelumnya, karena di situlah kesalahan mahal dibuat. Baca perbedaan setelahnya sebanding dengan apa yang dapat dihancurkan, menggunakan tangga daripada suasana hati Anda. Pertahankan manusia, secara pribadi, pada otorisasi, pembayaran, izin, data pribadi dan apa pun yang tidak dapat dibalik, karena model tidak dapat memegang akuntabilitas dan agen kedua berbagi titik buta yang pertama. Berikan semua yang lain kepada pengujian, tipe, gerbang dan peninjau yang tidak berbagi model penulis.
Tim yang salah memahami ini gagal dalam salah satu dari dua arah, dan keduanya dapat dihindari. Satu meninjau semuanya, menjadi bottleneck, dan diam-diam mulai menyetujui tanpa membaca, yang merupakan yang terburuk dari kedua dunia. Yang lainnya tidak meninjau sama sekali, mengirim dengan cepat selama dua bulan, dan kemudian menghabiskan satu kuartal untuk membayar utang yang tidak pernah mereka lihat terakumulasi.
Perdebatan di standup Anda sebenarnya bukan tentang apakah agen baik. Ini tentang siapa yang bersedia menandatangani. Jawab itu, dan kebijakan tinjauan menulis dirinya sendiri.
Pertanyaan yang Sering Diajukan
Haruskah Anda masih meninjau kode yang dihasilkan AI?
Ya, tetapi tidak baris demi baris pada semuanya. Tinjau rencana sebelum agen mulai, lalu tinjau perbedaan sebanding dengan apa yang dapat dihancurkan oleh perubahan tersebut. Teks dan CSS mendapatkan telusuran. Otorisasi, pembayaran, izin, data pribadi dan migrasi dibaca baris demi baris oleh manusia, setiap kali.
Dapatkah agen AI meninjau kode agen AI lainnya?
Ini membantu, tetapi itu bukan pengganti untuk manusia pada kode yang berisiko. Dua agen dari keluarga model yang sama, diberikan konteks yang sama, cenderung gagal dalam arah yang sama. Kesalahan mereka berkorelasi, jadi agen kedua menangkap kesalahan ketik dan pengujian yang hilang tetapi berbagi titik buta yang menghasilkan bug. Jika Anda menggunakan peninjau agen, jalankan di model yang berbeda dari penulis.
Bagaimana Anda tahu jika agen AI membuat kesalahan?
Carilah tanda objektif dalam perbedaan daripada membaca untuk gaya. Yang terkuat: pengujian berubah dalam komit yang sama dengan kode yang mereka tutup, yang berarti hijau dibangun dan bukan diamati. Yang lainnya termasuk creep lingkup, pernyataan yang dinonaktifkan atau dilemahkan, API yang diciptakan, jalur lokal yang dikodekan keras dan ringkasan yang tidak cocok dengan perbedaan.
Apakah agen AI akan menggantikan peninjau kode manusia?
Mereka sudah menggantikan sebagian besar pembacaan baris. Mereka tidak dapat menggantikan tanda tangan. Akuntabilitas tidak berpindah ke model, jadi manusia masih memiliki keputusan untuk menggabungkan apa pun yang sulit untuk dibalik.
Apakah Anda perlu meninjau kode AI baris demi baris?
Hanya di mana radius ledakan membenarkannya. Tinjauan baris demi baris tidak dapat diskalakan melewati beberapa agen yang berjalan secara paralel, dan seorang manusia yang menelusuri perbedaan 900 baris pada pukul 6 sore menghasilkan tanda tangan tanpa menghasilkan pengetahuan. Habiskan perhatian itu pada perubahan yang mahal untuk dibatalkan.
Apa yang tidak boleh digabungkan tanpa tinjauan manusia?
Apa pun yang menyentuh otentikasi, pembayaran, izin, data pribadi, migrasi basis data, jalur penghapusan dan infrastruktur. Ini berbagi satu sifat: biaya untuk salah tidak sebanding dengan ukuran perbedaan.
Unduh AgentsRoom
Jalankan agen AI Anda (Claude, Codex, Antigravity CLI, OpenCode, Aider, Grok Build, Mistral Vibe, Kimi Code) di semua proyek Anda, dari satu jendela.
Aplikasi pendamping: pantau agen Anda saat bepergian
Gunakan Claude, Codex, Antigravity CLI, atau penyedia AI lainnya.
Kirim bug dan permintaan langsung ke backlog publik Anda.
Sekilas AgentsRoom dalam aksi.