📑 Daftar Isi

Ilustrasi AI agent yang mengelola memori operasional di atas lapisan data perusahaan

Biaya AI Agent Melonjak, Data Layer Jadi Penentu Skala Produksi

Penulis:Ida Farida
Terbit:
Diperbarui:
⏱️5 menit membaca
Bagikan:
  • Biaya generative AI tradisional naik linear, biaya multi-agent naik mengikuti kompleksitas tugas
  • AWS: PoC teks 100 interaksi/hari sekitar $40/bulan, PoC agent sekitar $840/bulan
  • Anthropic: sistem multi-agent pakai 15x lebih banyak token daripada chat
  • Memori agent menjadi sistem operasional hidup, bukan sekadar konteks
  • Tiga prinsip desain: concurrency, shared memory, pemisahan memori aktif dan historis
  • Biaya per tugas ditentukan jumlah agent dan volume memori tersimpan
  • Uji beban tulis dan retensi saat sistem masih kecil agar biaya tersembunyi terlihat

Telset.id – Peralihan dari chatbot pasif ke sistem multi-agent mengubah struktur biaya proyek AI perusahaan secara signifikan. Tobie Morgan Hitchcock, CEO & Co-Founder SurrealDB, mengungkapkan bahwa biaya generative AI tradisional naik secara linear seiring jumlah pengguna, sedangkan biaya menjalankan deployment multi-agent cenderung melonjak mengikuti kompleksitas tugas. Artinya, ketika perusahaan memperbanyak AI agent, beban terbesar tidak lagi hanya pada model, melainkan pada lapisan data yang menopang operasinya.

Perubahan ini muncul karena AI agent mengambil informasi secara dinamis dan menyesuaikan state mereka sendiri dalam prosesnya. Saat tugas berkembang, agent harus mengelola pengembangan rencana, panggilan tool ke luar, pembaruan catatan, hingga pencatatan hasil. Ketika aktivitas itu dikalikan dengan ratusan atau ribuan agent, data layer berperilaku sangat berbeda dibandingkan sistem konvensional. Implikasinya menyentuh dua hal sekaligus: biaya dan akurasi. Keduanya kini menjadi pertimbangan utama saat memindahkan proyek AI agentic dari pilot ke produksi.

Angka dari AWS memperlihatkan jarak yang lebar. Proof of concept berbasis teks yang menangani sekitar 100 interaksi per hari diperkirakan menelan biaya sekitar $40 per bulan. Sementara estimasi untuk proof of concept berbasis agent yang menggunakan knowledge base dan guardrails pada volume kurang lebih sama mencapai sekitar $840 per bulan. Temuan ini sejalan dengan tulisan Anthropic mengenai riset multi-agent mereka, yang menunjukkan sistem multi-agent memakai 15x lebih banyak token dibandingkan interaksi chat, dan bahwa kelayakan ekonominya menuntut nilai tugas yang cukup tinggi untuk menutup pengeluaran tersebut.

Memori Agent Jadi Sistem Operasional

Pilot AI tahap awal umumnya sempit secara desain. Biasanya hanya satu tim yang bekerja dengan dataset terbatas serta interaksi sederhana dan berumur pendek, misalnya meminta ringkasan sebuah dokumen. Model menyelesaikan permintaan, lalu tugas itu selesai. Di tahap ini, akses model, token, dan pengambilan konteks tampak mendominasi tagihan.

Namun agent memiliki masa operasional yang lebih panjang daripada sesi chatbot biasa. Mereka harus mengingat tindakan hari sebelumnya, menyimpan bukti di balik sebuah keputusan, dan membuat informasi itu tersedia bagi agent lain dalam armada. Setiap tugas yang selesai menjadi state baru. Ketika armada agent bertambah besar, perusahaan tidak hanya membayar jawaban berikutnya, tetapi juga operational provenance yang terus mengembang agar sistem tetap berjalan efisien dan aman.

Karena itu, generative AI tahap awal sering memperlakukan memori sebagai konteks yang diambil saat dibutuhkan. Agent persisten menuntut hal berbeda: memori menjadi sistem operasional hidup yang terus diperbarui. Ini berdampak pada performa sekaligus biaya. Jalur penulisan yang sempit dapat menimbulkan contention ketika makin banyak agent memperbarui catatan. Salinan konteks yang terpisah menambah beban penyimpanan dan sinkronisasi, dan menyimpan seluruh catatan historis di tier penyimpanan tercepat membuat informasi yang jarang dipakai menjadi mahal tanpa perlu.

A robot standing thoughtfully in front of a giant digital display with code on it

Saat merancang data layer untuk mendukung armada agent, service level menentukan bagaimana memori diakses dan dikelola. Para pemimpin perlu menetapkan seberapa cepat setiap jenis memori harus tersedia, siapa yang boleh memperbaruinya, agent mana yang harus berbagi memori tersebut, dan berapa lama informasi itu harus tetap dapat diakses segera. Pertimbangan ini terasa teknis, tetapi pada praktiknya menetapkan model ekonomi deployment. Menyelesaikannya sebelum armada agent membesar jauh lebih murah daripada memperbaikinya setelah sistem berjalan luas.

Tiga Prinsip Desain Memori untuk Armada Agent

Ada tiga prinsip utama yang akan makin penting seiring bertambahnya variasi dan kompleksitas deployment agent. Pertama adalah concurrency. Pemimpin perlu menanyakan apakah kapasitas penulisan dapat tumbuh seiring bertambahnya jumlah agent. Infrastruktur yang dirancang terutama untuk aplikasi read-heavy bisa berperilaku sangat berbeda ketika banyak proses otonom mulai memperbarui state pada saat yang sama. Isu ini juga menyeruak di sisi keamanan, seperti tergambar dalam pembahasan soal keamanan AI agent.

Kedua adalah shared memory. Jika beberapa agent mengerjakan pelanggan, aset, atau proses yang sama, membuat salinan konteks yang terpisah dapat memunculkan biaya dan inkonsistensi. Sumber state yang sama dapat mempermudah kolaborasi, asalkan kontrol akses dan provenance tetap jelas.

Ketiga adalah memisahkan memori aktif dari memori historis. Seorang agent mungkin membutuhkan beberapa menit terakhir dari sebuah alur kerja secara langsung, sementara catatan dari enam bulan lalu hanya diperlukan untuk audit atau kueri yang tidak biasa. Memperlakukan kedua kategori itu secara identik adalah default yang mahal. State yang sering diakses dapat tetap berada dekat dengan lapisan compute, sementara informasi lama dipindahkan ke penyimpanan durable berbiaya lebih rendah. Compute kemudian dapat diskalakan sesuai aktivitas saat ini, bukan berdasarkan total memori yang terakumulasi sejak sistem diluncurkan.

A line of robots typing at computers

Cara menyimpan perubahan historis juga memunculkan pertanyaan serupa. Menyimpan setiap versi lengkap dari sebuah catatan membuat pengambilan data menjadi lugas, tetapi memakan kapasitas lebih besar. Menyimpan hanya perubahan inkremental menggunakan ruang lebih sedikit, namun merekonstruksi state lama bisa memakan waktu lebih lama. Snapshot berkala yang dikombinasikan dengan perubahan kecil di antara periode tersebut dapat menjadi jalan tengah yang berguna.

Pilihan arsitektur semacam ini juga menentukan seberapa mulus pengalaman pengguna akhir ketika berinteraksi dengan layanan berbasis AI. Sejumlah fitur di perangkat konsumen, misalnya fitur Hidden Toggle di iPhone 14 Pro, menunjukkan bagaimana lapisan privasi dan kontrol data kini menjadi bagian dari desain produk sehari-hari.

Yang perlu ditetapkan sebelum melakukan scaling mencakup sejumlah parameter terukur. Berapa banyak state yang ditulis setiap agent dan seberapa sering; berapa banyak agent yang boleh memperbarui pelanggan, aset, atau alur kerja yang sama secara bersamaan; berapa banyak memori yang butuh akses langsung versus penyimpanan durable yang lebih murah setelah sehari, sepekan, atau sebulan; dan apakah konteks dapat dibagikan dengan aman alih-alih disalin per agent. Setiap langkah membawa biaya, dan bersama-sama menentukan angka yang memutuskan kelayakan pada skala besar, yakni biaya per tugas yang ditentukan oleh jumlah agent sekaligus volume memori yang disimpan.

Menyelesaikan pertimbangan ini sebelum ekspansi mengubah desain pilot itu sendiri. Sebuah tim dapat menguji beban penulisan, aturan retensi, dan model berbagi yang diharapkan di lingkungan produksi selagi sistem masih kecil. Pada titik inilah biaya tersembunyi menjadi terlihat dan murah untuk diperbaiki.

Hands typing on a tablet with AI superimposed in text in front

Meskipun harga model terus turun dan inferensi menjadi lebih efisien, deployment agent berskala besar tetap akan menghasilkan aliran data operasional yang terus bertambah dan harus ditulis, dibagikan, dilindungi, diambil, serta disimpan. Biaya aktivitas itu sangat bergantung pada arsitektur di bawah model. Karena itu, perusahaan yang merencanakan tahap berikutnya dari adopsi AI sebaiknya mengukur seluruh siklus hidup sebuah tugas agent, termasuk memori yang ditinggalkannya. Melakukan hal itu sebelum pilot berubah menjadi armada penuh memberi para pemimpin teknologi pandangan yang jauh lebih jelas tentang apakah sebuah sistem AI akan tetap ekonomis ketika mencapai skala produksi.

Ikuti Telset.id di Google NewsFollow

Komentar

Belum ada komentar.