Telset.id – Model keputusan buatan TypeSafe AI bernama Jev berhasil menamatkan Pokémon Red dan masuk Hall of Fame pada 23 September 2026, setelah mengalahkan Elite Four dan Champion. Pencapaian ini menjadikan Jev sebagai salah satu sistem AI yang menyelesaikan game klasik tersebut, meski tidak berjalan sendiri. Jev hanya bisa memilih dari daftar opsi yang tersedia, sementara Claude Opus 5 dari Anthropic memantau log permainan dan menyesuaikan opsi serta kata-katanya selama Jev bermain.
Jev bukan chatbot dan bukan LLM. Model ini merupakan model keputusan yang dirilis baru-baru ini dan mengembalikan solusi dengan angka keyakinan. Dalam permainan, Jev mengacu pada daftar opsi berisi fakta, lalu memilih opsi terbaik berdasarkan probabilitas. Jev tidak membaca layar dan tidak menghasilkan teks atau gambar. Karena itu, kehadiran Claude Opus 5 menjadi krusial: LLM tradisional tersebut memantau log permainan untuk membantu Jev saat tersangkut, secara tidak langsung dengan mengubah opsi dan data yang tersedia bagi Jev.
Pengembang proyek ini, Andrew Boyd, adalah pendiri Standard Agents Inc., perusahaan yang menjual platform untuk membangun agen AI. Boyd awalnya mengumumkan proyek tersebut di X dengan target kemenangan dalam sepekan. Permainan disiarkan langsung, dapat diakses melalui browser atau terminal, dengan chat yang dimoderatori oleh Jev sendiri.
474 Entri Changelog dan Kesalahan Beruntun Jev
Halaman changelog harness proyek ini mencatat 474 entri, sebagian besar berisi kegagalan dari log permainan yang dipasangkan dengan perubahan yang dilakukan sebagai respons. Beberapa contoh kesalahan yang tercatat antara lain berjalan “ke pintu masuk Lorelei yang tertutup sebanyak 53 kali”, melewati satu tangga Rock Tunnel “124 kali dalam sepuluh menit”, serta kalah dari Alakazam milik Champion setelah mengalahkan keempat trainer Elite Four. Kekalahan itu memaksa Jev mengalahkan keempat trainer Elite Four lagi sebelum akhirnya menumbangkan Champion pada hari yang sama.
Opus melakukan penyesuaian untuk akurasi sekaligus biaya. Menggunakan catatan tentang model dari TypeSafe, Opus mengurangi teks yang dikirim ke Jev sekitar dua pertiga dan menggunakan kata alih-alih angka. Ketika Jev terjebak dalam loop, harness diubah agar hanya meminta keputusan setiap enam detik, bukan sekitar sekali per detik. Input manusia juga berperan: penonton mengirim tips di chat, dan tips yang membantu digunakan untuk memperbaiki daftar opsi Jev.
Baca Juga:
Ketergantungan pada Opus, pengembang, dan audiens ini memperlihatkan kekuatan sekaligus keterbatasan model keputusan. Jev sendiri diposisikan sebagai alternatif dari LLM. Klaim yang menyertainya menyebut model ini 193x lebih cepat dan 445x lebih murah dibanding LLM. TypeSafe juga menyatakan bahwa tugas terbuka lebih cocok ditangani oleh LLM, sebagaimana dilaporkan saat Jev diluncurkan.

Pendekatan Lain: Frigade dan World Model di RTX 3080 Ti
Percobaan berbasis Jev kedua dilakukan oleh Christian Mathiesen di Frigade dengan pendekatan berbeda. Menurut README-nya, harness tersebut “membaca memori game, mendaftar opsi legal … dan Jev memilih satu”, tetapi tidak pernah menulis ke memori game. Mathiesen menyebut versi pertamanya, tempat Jev bisa memilih tombol secara langsung, “tidak pernah meninggalkan Pallet Town”. Estimasi biayanya “sekitar $1–1,70 per 24 jam”.
Eksperimen Pokémon Red terpisah menempuh jalur lain. Seorang developer dengan nama stmonty melatih world model kecil di RTX 3080 Ti dengan lebih dari 42.000 frame gameplay. Berawal dari save di laboratorium Professor Oak, model itu memilih starter dalam 52 dari 100 percobaan, menurut tulisan blog stmonty. Baik tujuan maupun bantuannya jauh lebih kecil dibanding Jev: model stmonty harus mempelajari sendiri fungsi setiap input hanya dari screenshot.
Jev sendiri disebut bersifat viral. LangChain menggambarkannya sebagai proyek yang “mendapat respons cukup besar” sejak diluncurkan pada 15 September, dan dalam 10 hari sudah ada beberapa developer yang memainkan game tersebut. Sebagai perbandingan, stream Claude Plays Pokémon dari Anthropic yang saat itu menjalankan Opus 4.5 belum menyelesaikan Red hingga Januari. Kali ini, dengan Jev sebagai pemain dan Claude yang menulis aturan, sang developer meraih kemenangan.
Bagi developer yang ingin mengikuti perkembangan AI untuk coding dan eksperimen agen, sejumlah topik terkait turut menjadi sorotan, termasuk Windows 11 Project Zenith dan langkah OpenExecutive Pengganti CEO yang dibangun seorang developer. Keduanya menunjukkan bagaimana AI makin masuk ke alur kerja pengembangan.
Keberhasilan run Jev menunjukkan bahwa kolaborasi dengan model khusus dapat meningkatkan pemecahan masalah secara berarti. Namun, catatan changelog yang panjang, campur tangan Opus, dan tips dari penonton menegaskan bahwa model keputusan ini belum berdiri sendiri sepenuhnya.





Komentar
Belum ada komentar.