JAKARTA, BakabaNews — Panduan memberi perintah ke kecerdasan buatan bertebaran di media sosial, sebagian besar berupa resep yang diyakini manjur tanpa pernah diuji. Sejumlah penelitian beberapa tahun terakhir menguji keyakinan-keyakinan itu satu per satu, dan hasilnya memangkas banyak nasihat populer.
Teknik yang terbukti, dengan batasannya
Teknik paling terkenal adalah meminta model menguraikan langkah berpikirnya, dikenal sebagai chain of thought. Makalah yang memperkenalkannya pada 2022 mencatat lonjakan besar: pada kumpulan soal matematika sekolah dasar, akurasi model kala itu naik dari 17,9 persen menjadi 56,9 persen.
Angka sebesar itu membuat teknik ini dianggap berlaku universal. Meta-analisis yang dipresentasikan pada konferensi ICLR 2025, mencakup lebih dari 100 makalah ditambah pengujian sendiri atas 20 kumpulan data dan 14 model, menunjukkan gambaran yang jauh lebih sempit:
- Soal matematika: rata-rata naik 12,3 poin persentase
- Soal simbolik dan algoritmik: naik 14,2 poin persentase
- Penalaran logika: naik 6,9 poin persentase
- Seluruh kategori lainnya digabung: naik 0,7 poin persentase — praktis tidak berarti
Pada tolok ukur pengetahuan umum MMLU, sekitar 95 persen dari keseluruhan peningkatan berasal dari soal yang mengandung tanda sama dengan. Untuk soal non-matematika, manfaatnya tidak terukur.
Perkembangan model juga menggerus manfaatnya. Pengujian Wharton Generative AI Labs pada Juni 2025 terhadap soal sains tingkat doktoral menemukan model penalaran generasi baru — yang memang sudah menguraikan langkah berpikirnya secara internal — hanya naik sekitar 3 persen ketika diminta melakukannya secara eksplisit, dan satu model justru turun 3,3 persen. Instruksi tambahan itu menambah waktu tunggu 20 sampai 80 persen.
Kesimpulan praktisnya: menyuruh model berpikir bertahap masih berguna untuk soal hitungan pada model biasa, tetapi bukan mantra serbaguna, dan makin tidak relevan pada model penalaran terbaru.
Memberi contoh tetap berguna
Teknik yang lebih tua dan tetap bertahan adalah menyertakan beberapa contoh hasil yang diinginkan di dalam perintah. Kemampuan model mengerjakan tugas hanya dari contoh dalam teks, tanpa pelatihan ulang, adalah temuan inti makalah GPT-3 pada 2020.
Untuk pekerjaan dengan format keluaran tertentu — merapikan data, menyeragamkan gaya penulisan, mengklasifikasi — menunjukkan dua atau tiga contoh biasanya lebih efektif daripada menjelaskan aturannya panjang lebar.
Yang ternyata tidak terbukti
Mengancam atau menjanjikan imbalan. Keyakinan bahwa model bekerja lebih baik bila diancam sempat ramai setelah dilontarkan seorang petinggi perusahaan teknologi. Penelitian yang terbit Agustus 2025 mengujinya pada dua tolok ukur sulit dan menemukan ancaman maupun janji tip tidak memberi pengaruh signifikan terhadap performa keseluruhan. Jawaban pada soal-soal individual memang bergeser, tetapi arahnya tidak bisa diramalkan.
Kesopanan. Bukti soal ini tidak konsisten. Satu studi 2025 justru mencatat perintah bernada kasar sedikit lebih akurat daripada yang sangat sopan, sementara studi lintas bahasa sebelumnya menemukan perintah yang sangat tidak sopan bisa menurunkan performa, tanpa jaminan bahwa kesopanan berlebih menaikkannya. Tingkat kesopanan yang optimal juga berbeda antarbahasa. Kesimpulan yang aman: tidak ada efek kesopanan yang bisa diandalkan — yang tetap masuk akal adalah menulis dengan jelas.
Rayuan emosional. Klaim bahwa menambahkan kalimat seperti "ini sangat penting bagi karier saya" meningkatkan hasil ditinjau ulang pada 2024. Setelah dirata-ratakan atas seluruh variasi kalimat, bukan hanya yang terbaik, peningkatannya menyusut menjadi sekitar 2,6 persen secara relatif — jauh dari klaim awal yang bersandar pada pemilihan hasil terbaik.
Meminta model berperan sebagai pakar. Menyuruh model berlagak sebagai profesor atau ahli bidang tertentu termasuk nasihat paling sering diulang. Penelitian yang khusus mengujinya menyimpulkan persona pakar tidak memperbaiki akurasi faktual. Persona masih berguna untuk mengatur gaya bahasa dan sudut pandang keluaran, tetapi bukan untuk membuat jawabannya lebih benar.
Hasil yang tidak stabil
Temuan yang paling penting justru soal keandalan. Dalam pengujian yang mengulang pertanyaan yang sama seratus kali, perbedaan kata seperti "tolong" dibandingkan "saya perintahkan" bisa menggeser akurasi pada satu soal hingga 60 poin persentase — tetapi pergeseran itu saling meniadakan pada keseluruhan kumpulan soal.
Yang lebih menohok, ketika syaratnya diperketat menjadi "harus benar pada seluruh pengulangan", model yang diuji tidak lebih baik daripada menebak, padahal mencatat sekitar 51 persen bila syaratnya dilonggarkan. Model yang sama, kondisi yang sama, jawaban yang berubah-ubah.
Menempelkan sumber membantu, tapi bukan jaminan
Cara yang lebih menentukan daripada pilihan kata adalah memberi model bahan yang benar. Pendekatan ini dikenal sebagai retrieval augmented generation, yaitu mengambil dokumen relevan lalu menyertakannya sebagai konteks.
Efeknya nyata, tetapi tidak menghapus kesalahan. Penelitian Stanford yang menguji perangkat riset hukum berbasis teknik ini menemukan tingkat informasi keliru masih di atas 17 persen pada dua produk, dan di atas 34 persen pada satu produk lain — meski jauh lebih baik daripada model tanpa sumber yang salah pada 58 sampai 82 persen kasus pertanyaan hukum.
Sebagian kesalahan berupa kutipan yang tidak berdasar: pernyataannya benar, tetapi rujukan yang disebut tidak mendukungnya. Penelitian lain menemukan model kerap tetap menjawab alih-alih mengaku tidak tahu ketika konteks yang tersedia sebenarnya tidak memadai.
Ringkasnya
Yang layak dilakukan: menyertakan contoh keluaran yang diinginkan, menempelkan dokumen sumber, menyatakan format hasil secara spesifik, dan meminta uraian langkah untuk soal hitungan. Yang tidak perlu: mengancam, merayu, menjanjikan imbalan, atau menyusun persona pakar demi akurasi.
Dan karena jawaban dapat berbeda pada pertanyaan yang sama, satu jawaban yang tampak meyakinkan bukan bukti bahwa perintahnya sudah benar. Untuk pekerjaan yang penting, mengulang pertanyaan beberapa kali dan membandingkan hasilnya lebih berguna daripada mencari susunan kata yang dianggap ajaib.