10 Oktober 2026•baca 7 menit

Cara kamu pakai AI lebih menentukan daripada apakah kamu pakai AI

Fiturnya selesai, test-nya hijau, dan dua hari kemudian kamu baca kodenya kayak kode orang lain. Ternyata ada satu cara pakai AI yang bikin kamu paham lebih baik daripada nggak pakai AI sama sekali. Yuk lihat datanya.

Fiturnya selesai dalam 40 menit. Semua test hijau, diff-nya rapi, dan kamu langsung push sambil merasa hari ini produktif banget. 🚀 Nggak ada yang aneh, nggak ada yang mengganjal.

Dua hari kemudian muncul bug. Kamu buka filenya, dan kodenya terasa kayak kode orang lain: nama variabelnya masuk akal, alurnya rapi, tapi kamu lupa kenapa ditulis begitu. Kamu bisa memperbaikinya, bahkan cukup cepat. Hanya saja kamu belum tahu kenapa perbaikan itu benar, dan perasaan itu nggak enak.

Kalau itu pernah kita alami bareng-bareng, jangan buru-buru nyalahin diri sendiri. Gejala ini sudah diukur orang, dan hasilnya lebih spesifik daripada sekadar "AI bikin malas". Yuk kita lihat datanya satu per satu.

Poin Penting

Hasil belajar dari AI coding ditentukan oleh cara interaksinya, bukan oleh alatnya, karena mendelegasikan seluruh pekerjaan melewati proses yang justru membangun pemahaman.

  • Kelompok yang memakai AI di eksperimen Anthropic cuma unggul 2 menit yang nggak signifikan, sementara skor pemahaman kuisnya jatuh dari 67% ke 50%.
  • Pola yang paling mulus—menyerahkan semua kode ke AI—justru skornya paling rendah (39%), sedangkan generate dulu lalu diinterogasi bisa menembus 86%, di atas kelompok tanpa AI.
  • Perasaan produktif nggak bisa dipakai sebagai alat ukur, karena 16 developer berpengalaman di studi METR justru 19% lebih lambat sambil merasa 20% lebih cepat.
  • Yang paling turun saat kepercayaan ke AI naik adalah kemampuan menilai output, dan itu persis kemampuan yang dibutuhkan buat tahu kodenya salah.

Apa sih yang terukur di eksperimen Anthropic?

Anthropic menjalankan sebuah randomized controlled trial dengan 52 engineer, mayoritas junior. Tugasnya sama untuk semua: belajar satu library Python bernama Trio yang belum pernah mereka pakai. Separuh boleh pakai AI, separuh lagi ngetik manual.

Kelompok yang pakai AI memang selesai sekitar 2 menit lebih cepat. Tapi selisih sekecil itu masih bisa saja kebetulan—hitungan statistiknya nggak cukup kuat buat disebut nyata. Yang jelas beda justru di kuis pemahaman: kelompok pakai AI dapat 50%, kelompok yang ngetik manual dapat 67%. Jarak 17 poin itu nggak kecil, kira-kira setara beda dua tingkat nilai.

Selisih terbesar ada di pertanyaan debugging, bukan hafalan API. Jadi yang bertambah cuma 2 menit yang bahkan belum tentu nyata, sedangkan yang berkurang adalah kemampuan tahu kapan kodenya salah. Itu tukar tambah yang jelek banget. 😬

Enam pola pakai AI, dan skornya jauh beda

Nah, bagian ini yang paling berguna. Peneliti yang sama memperhatikan bagaimana tiap orang memakai AI, lalu mengelompokkannya jadi enam pola. Skor kuis tiap pola berbeda jauh:

Pola Artinya Skor kuis
Iterative AI debugging Pakai AI buat mecahin masalah 24%
Progressive AI reliance Perlahan menyerahkan semuanya 35%
AI delegation Menyerahkan semua sejak awal 39%
Conceptual inquiry Cuma tanya konsep, nulis sendiri 65%
Hybrid code + explanation Minta kode plus penjelasannya 68%
Generation, then comprehension Generate dulu, lalu diinterogasi 86%

Perhatikan dua hal. Pola yang paling cepat dan paling mulus—menyerahkan semuanya, hampir tanpa error—justru skornya 39%. Rasanya enak, hasilnya jelek.

Satu-satunya pola yang mengalahkan kelompok tanpa AI sama sekali (86% vs 67%) adalah generate dulu, lalu tanya balik. Artinya AI-nya tetap ada, yang berubah cuma urutan kerjanya: kode datang duluan, pemahaman menyusul lewat interogasi.

Ini persis alasan inva (blog ini) ngasih gejala dulu, bukan solusi siap pakai. Kalau kamu cuma dikasih jawaban, kamu ada di pola yang skornya rendah. Kalau kamu diajak melihat gejalanya, kamu punya bahan buat bertanya balik.

Kalau mau mencobanya langsung, mampir ke halaman Lab di blog ini. Isinya bukan tutorial, tapi repo kecil yang sengaja dibuat lambat atau salah dengan cara yang realistis. Kamu nggak dikasih jawabannya di depan; yang kamu dapat tuh cuma gejala dan target yang harus dicapai mesin. Kunci jawabannya disimpan di branch terpisah, dan baru boleh dibuka kalau kamu sudah mentok. 😅

Kenapa ini masuk akal, bukan kebetulan?

Memang sih, satu eksperimen bisa saja kebetulan. Tapi arahnya cocok dengan penelitian lain. Tim Microsoft dan Carnegie Mellon, di CHI 2025, menyurvei 319 pekerja pengetahuan dan mengumpulkan 936 contoh kerja nyata. Temuannya: makin tinggi kepercayaan ke AI, makin rendah usaha kognitif yang mereka rasakan.

Penurunan terbesar ada di evaluation (β = −0,23, p < 0,001). Berikutnya analysis (−0,15), comprehension (−0,13), synthesis (−0,12), dan knowledge (−0,11). Bacaannya: yang paling turun justru kemampuan menilai, padahal itu persis yang kamu butuhkan buat tahu output AI salah.

Satu catatan penting: ini self-report, laporan orang tentang dirinya sendiri, bukan pengukuran langsung. Jadi anggap ini penguat arah, bukan bukti mutlak.

Perasaan produktif itu bisa dipercaya nggak?

Gimana kalau kita ukur kecepatannya langsung? Itu yang dilakukan METR dalam RCT mereka: 16 developer open-source berpengalaman mengerjakan 246 task di repo mereka sendiri, kadang dengan AI, kadang tanpa.

Hasilnya, dengan AI mereka 19% lebih lambat. Tapi setelah selesai, mereka merasa 20% lebih cepat. Sebelum mulai, ekspektasi mereka malah 24% lebih cepat. Jaraknya sekitar 39 poin antara perasaan dan kenyataan.

Jadi perasaan "aku produktif" nggak bisa dipakai sebagai alat ukur. Dan ini terjadi pada orang yang paham betul repo-nya, lho! Kalau mereka saja bisa meleset sejauh itu, kita nggak punya alasan buat merasa kebal.

Survei developer bilang apa?

Bagian ini cuma penguat, jadi singkat saja. Di survei Stack Overflow 2025, 66% responden frustrasi karena "AI solutions that are almost right, but not quite". Sebanyak 46% nggak percaya akurasi output AI, dan cuma 3% yang sangat percaya.

Di State of AI 2026, hal yang paling dirasa hilang dari AI adalah truthfulness (kejujuran), dengan 2.801 suara, di atas long-term memory dan up-to-date knowledge. Pain point nomor satu adalah halusinasi. Jadi yang diminta developer itu bersifat epistemik, yaitu soal bisa dipercaya atau nggak, bukan model yang makin pintar.

Tapi jangan berhenti di "AI bikin tumpul"

Sampai sini gampang menyimpulkan bahwa AI menumpulkan kita. Padahal ada pertanyaan yang lebih menakutkan: apa yang terjadi kalau alatnya diambil?

MIT Media Lab meneliti 54 partisipan dengan EEG selama 4 sesi dalam 4 bulan. Konektivitas otak turun seiring besarnya dukungan eksternal. Yang paling menarik ada di sesi ke-4: kelompok yang biasa pakai LLM dipaksa kerja tanpa alat, dan hasilnya justru paling lemah. Itu bukan penurunan permanen. Itu efek dilepas dari alat.

Catatan penting: tugasnya menulis esai, bukan coding. Sampelnya kecil, dari satu wilayah, dan masih preprint yang belum peer-review. Penulisnya sendiri melarang framing "bikin bodoh". Jadi ambil secukupnya: ada sinyal awal, tapi belum cukup buat dikutip sebagai kesimpulan.

Ada dua data lain yang sifatnya juga longgar. Studi BCG/HBR tentang brain fry (Maret 2026, sekitar 1.488 pekerja) menyebut pemakaian 4+ alat AI malah menurunkan produktivitas. Sebanyak 14% mengalami kelelahan kognitif, dan di marketing angkanya 26%. Angka ini dari pemberitaan sekunder karena HBR-nya paywalled, jadi jangan diperlakukan seperti sumber akademis.

Lalu laporan DORA: kenaikan 25% adopsi AI berkaitan dengan throughput −1,5% dan stabilitas −7,2%. Edisi berikutnya arah throughput-nya berubah, tapi ketidakstabilannya tetap naik. Ketiga sumber ini mengukur hal yang berbeda—kognisi, beban kerja, dan stabilitas rilis—jadi jangan digabung jadi satu kesimpulan besar. Masing-masing cuma sinyal kecil.

Jadi praktisnya gimana?

Nggak perlu berhenti pakai AI. Cukup ubah caranya:

  • Jangan serahkan semuanya, bahkan kalau hasilnya paling mulus. Di tabel tadi, pola itu skor kuis pemahamannya cuma 39%, jauh di bawah 67% punya orang yang ngetik sendiri.
  • Setelah kode jadi, paksa satu putaran interogasi: kenapa baris ini ada, apa yang terjadi kalau datanya kosong, di mana dia bakal gagal.
  • Jam debugging manual jangan dihilangkan. Itu bagian yang paling cepat hilang.
  • Kalau ada fitur yang kamu sendiri nggak bisa jelaskan besoknya, itu bukan kode kamu.

Coba terapkan yang kedua di fitur berikutnya deh, sebelum push. Dari situ kamu langsung tahu bagian mana yang sebenarnya kamu pahami.

Bagian jujurnya: apa yang belum kita tahu

Ada batas yang perlu diakui. RCT Anthropic cuma mengukur pemahaman langsung setelah tugas terbatas 35 menit. Belum ada yang mengukur efeknya berbulan-bulan, dan jawabannya memang belum ada.

Enam pola tadi juga diukur pada orang yang baru belajar library asing. Di pekerjaan sehari-hari yang sudah kamu kuasai, hasilnya bisa beda. Bukti fisiologis pada developer masih tipis: protokolnya sudah ada, hasilnya belum.

Urutan yang sekarang jalan di sini

Bukan resep yang wajib kamu ikut, cuma urutan yang sekarang dipakai dan lumayan nahan kebiasaan mendelegasikan semuanya:

  1. Brainstorm di kertas, tanpa AI. Ini jadi dasar biar idenya tetap di jalur, dan ada kunci yang nggak goyah duluan.
  2. Hasil brainstorm diceritakan ke AI, lalu diminta masukan, saran, dan kritik apa pun. Biasanya pakai plan mode.
  3. Masukannya jadi bahan refine, tapi tetap disaring manual—nggak semuanya masuk akal.
  4. Baru dari plan yang sudah disepakati, AI disuruh implementasi.
  5. Setelah jadi, ganti peran: hasilnya diinterogasi, sudah sesuai yang dimau di awal apa belum. Dilakukan dengan skeptis penuh, nggak percaya sama hasilnya sendiri.
  6. Kalau sudah sesuai, baru merge ke codebase utama.

Langkah kelima itu yang paling sering dilewatkan orang, padahal di tabel Anthropic justru dia yang paling menentukan. Empat langkah sebelumnya cuma bikin langkah kelima jadi mungkin: kalau dasarnya kabur, yang bisa kamu tanyakan ke hasilnya juga nggak ada.

Yang perlu dijaga itu caranya

Alatnya nggak salah. Dua data paling kuat tadi malah menunjukkan hal yang sama: orang yang bertanya balik pada AI bisa mengalahkan orang yang nggak pakai AI sama sekali. Yang membedakan bukan ada atau nggaknya AI di editor kita, tapi apa yang kita lakukan setelah kodenya muncul.

Jadi pertanyaan buat kamu bukan "sudah pakai AI belum?", karena jawabannya hampir pasti sudah. Pertanyaannya: setelah kode itu jadi, apakah kamu masih bisa menjelaskannya tanpa melihat layar? Kalau bisa, caramu sudah benar. Kalau belum, ya tinggal tambah satu putaran tanya jawab. 🙂

Biar makin jago ngoding.

Yuk gabung bareng temen-temen developer lainnya buat dapet update teknologi, tips, dan tutorial santai tiap minggu.

Biar Nggak Kudet

Update teknologi, tips ngoding, dan insight santai langsung ke email kamu tiap minggu.

Santai, anti spam. Bisa berhenti langganan kapan aja.

Baca Selanjutnya

Lihat semua
karierKetika Pilih Framework Cuma Biar Kelihatan Beda

Terakhir kali kamu milih framework atau library baru, itu karena masalahmu butuh alat itu, atau karena alatnya kedengaran keren dan belum banyak yang pakai? Pertanyaan ini nggak enak dijawab. Soalnya keputusan teknologi sering diambil dengan alasan yang nggak pernah ditulis di dokumen teknis mana pun.

© 2026 Inva.dev.