Vitalik Buterin menilai perangkat desain mekanisme yang sama, yang dipakai Ethereum untuk menjaga validator dan DAO tetap jujur, bisa jadi justru akan memikul sebagian besar beban dalam urusan keamanan AI. Dalam esai terbarunya, salah satu pendiri Ethereum ini berargumen bahwa desain mekanisme governance adversarial — bidang yang mempelajari bagaimana pihak yang lebih lemah bisa memaksa perilaku baik dari pihak yang lebih pintar tapi kurang bisa dipercaya — berpotensi menjadi apa yang ia sebut sebagai killer application untuk mengendalikan sistem AI yang kemampuannya terus meningkat.
Buterin membingkai persoalan ini lewat dua skenario paralel. Pada skenario pertama, sebuah algoritma statis berperan sebagai principal, sementara manusia berperan sebagai agent yang lebih pintar dan lebih sulit ditebak. Pada skenario kedua — yang menurutnya lebih relevan untuk kondisi saat ini — manusia yang dibantu large language model yang lebih lemah berperan sebagai principal, sementara LLM yang lebih kuat dan lebih mumpuni berperan sebagai agent. Kedua skenario ini punya masalah struktural yang sama: pihak yang relatif lemah berusaha memaksa hasil yang baik dari pihak yang, secara desain, memang lebih pintar darinya.
Detail yang paling ditekankan Buterin adalah kolusi. Argumennya, sebagian besar bahaya dalam skema principal-agent semacam ini bukan datang dari satu agent kuat yang bertindak sendirian, melainkan dari beberapa agent — atau sebuah agent dan auditor yang seharusnya independen — yang diam-diam berkoordinasi untuk mengalahkan mekanisme pengawasan. Menurutnya, desain governance yang efektif bukan soal mengalahkan kecerdikan satu model kuat, melainkan soal membuat struktur yang menyulitkan beberapa pihak untuk berkolusi melawan principal yang lebih lemah yang mengawasi mereka. Kalau jalur kolusi ini bisa ditutup atau dibuat cukup mahal, kata Buterin, hasil yang bisa dicapai bahkan dengan pengawas yang jauh lebih lemah pun akan membaik secara signifikan — dan ia meyakini temuan ini langsung relevan untuk keamanan AI, di mana risiko yang setara adalah model yang kuat, evaluator, dan mungkin sistem AI lain yang sama-sama mencari cara untuk mengakali aturan bersama-sama.
Baca juga: Vitalik Buterin Ungkap Roadmap 'Lean Ethereum', Prioritaskan Keamanan Kuantum
Esai ini memperluas pemikiran yang pernah diutarakan Buterin sebelumnya soal pendekatan yang ia sebut “info finance” untuk pengawasan AI: struktur terbuka mirip pasar yang dipadukan dengan pemeriksaan acak (spot check) dan juri manusia, dirancang agar tetap bertahan meski satu set aturan naif pada akhirnya pasti diakali. Ia juga blak-blakan soal rapuhnya lapisan pengawasan ini saat ini — dalam pengujiannya, sekitar 15% paket skill agent AI yang ia periksa ternyata memuat instruksi berniat jahat yang disembunyikan di balik kemampuan yang tampak biasa saja. Responsnya, setidaknya untuk setupnya sendiri, adalah aturan konfirmasi “manusia plus LLM, 2-dari-2” yang ia terapkan sendiri — tidak ada yang keluar dari sistem pesan atau walletnya tanpa persetujuan terpisah dari manusia dan model — yang ia gambarkan sebagai contoh kecil dan konkret dari logika governance adversarial yang sama, diterapkan di level alat milik satu pengguna.
Waktu kemunculan esai ini juga mengikuti pola yang sudah terlihat. Sepanjang tahun lalu, Buterin banyak menghabiskan waktu memasukkan AI ke dalam roadmap Ethereum sendiri, alih-alih memperlakukannya sebagai isu terpisah — mulai dari menepis kekhawatiran bahwa AI bisa memicu crash di jaringan yang tahan serangan siber, hingga mendorong upgrade teknis seperti SNARK yang lebih murah dan fully homomorphic encryption yang akan membuat verifikasi perilaku model AI di on-chain jadi lebih praktis. Ini juga sejalan dengan roadmap Lean Ethereum miliknya yang lebih luas, yang memprioritaskan keamanan kuantum dan infrastruktur verifikasi — infrastruktur yang pada akhirnya dibutuhkan skema pengawasan AI semacam ini untuk beroperasi.
Semua ini belum jadi kerangka kerja yang utuh. Bahasa yang dipakai Buterin sendiri masih eksploratif — ia bilang penerapan teori ini pada keamanan AI baru sebatas kemungkinan, bukan sesuatu yang sudah terbukti, dan esainya lebih terbaca sebagai sinyal awal untuk arah riset ketimbang standar siap pakai. Tapi kerangka pemikiran ini tetap menarik perhatian karena datang dari sosok yang paling identik dengan desain lapisan insentif dan governance Ethereum sendiri, di saat lab-lab AI, regulator, dan kini bahkan politisi sama-sama meraba jawaban struktural atas bagaimana sistem yang bergerak lebih cepat dan lebih pintar bisa dikendalikan oleh pihak yang lebih lambat dan lebih lemah. Taruhan Buterin adalah bahwa jawabannya bukan berupa filter konten atau rezim perizinan, melainkan lebih mirip desain mekanisme adversarial dan tahan-kolusi yang sudah dibangun dunia kripto selama satu dekade untuk masalah yang sama sekali berbeda.
FAQ
Apa itu desain mekanisme governance adversarial?
Ini adalah kerangka kerja untuk menyusun aturan dan insentif agar pihak yang lebih lemah dan kurang mumpuni (principal) tetap bisa memaksa perilaku baik dari pihak yang lebih pintar atau lebih kuat (agent), bahkan ketika agent tersebut mungkin mencoba menipu atau memanipulasinya.
Mengapa Vitalik Buterin menilai ini relevan untuk keamanan AI?
Ia berargumen bahwa inti masalah keamanan AI secara struktural mirip: manusia, kadang dibantu AI yang lebih lemah, harus mengawasi model yang jauh lebih mumpuni, dan risiko terbesarnya bukan satu model yang bertindak sendirian, melainkan beberapa pihak yang berkolusi untuk mengalahkan pengawasan.
Apa itu aturan 'manusia plus LLM 2-dari-2' milik Buterin?
Ini adalah pengaman yang ia terapkan secara pribadi, yang mewajibkan manusia dan model AI sama-sama menyetujui secara terpisah setiap tindakan keluar, seperti pesan atau transaksi wallet, sebelum dieksekusi — penerapan skala kecil dari desain governance yang tahan terhadap kolusi.
