Home / Artikel / AI & Teknologi
AI & Teknologi

AI Agent Kini Bisa Bekerja Berjam-jam: Mengapa Pagar Pengaman Lebih Penting daripada Prompt Panjang

AI agent mulai bergeser dari chatbot yang menunggu perintah menjadi sistem yang bisa menjalankan tugas bertahap selama berjam-jam. Perubahan ini menjanjikan produktivitas lebih tinggi, tetapi juga membuat kontrol akses,…

AI Agent Kini Bisa Bekerja Berjam-jam: Mengapa Pagar Pengaman Lebih Penting daripada Prompt Panjang

Perbedaan antara chatbot dan AI agent mulai terasa jelas. Chatbot biasanya menjawab pertanyaan lalu berhenti. AI agent dapat menerima tujuan, memecahnya menjadi beberapa langkah, memakai alat, membaca file, menjalankan kode, lalu mengulang proses sampai pekerjaan selesai.

Perubahan ini penting karena cara kita bekerja dengan AI ikut berubah. Kita tidak lagi hanya meminta “buatkan ringkasan”, tetapi bisa memberikan tugas seperti “periksa penyebab kenaikan error API, bandingkan dengan perubahan deployment terakhir, lalu simpan temuan dan rekomendasi”.

Pada 10 September 2026, OpenAI memperkenalkan Agents API dalam status public beta. Platform ini dirancang untuk menjalankan agent dalam sesi panjang, menggunakan lingkungan kerja, mengelola konteks, memakai berbagai alat, dan membagi pekerjaan ke subagent. Dokumentasi pengumuman OpenAI menyebut agent dapat bekerja dengan file, menjalankan kode, menyimpan hasil sementara, dan beroperasi dalam sesi yang berlangsung lama.

Dari “menjawab” menjadi “menyelesaikan”

Secara praktis, agent mengubah unit kerja dari satu interaksi menjadi satu rangkaian pekerjaan. Dalam laporan internal yang diterbitkan OpenAI, perusahaan itu menyatakan bahwa penggunaan Codex semakin bergeser ke tugas dengan durasi lebih panjang. Pada Mei 2026, 70,2 persen pengguna yang dianalisis mengajukan setidaknya satu tugas yang diperkirakan membutuhkan lebih dari satu jam jika dikerjakan manusia. Angka tersebut berasal dari data penggunaan Codex milik OpenAI, sehingga sebaiknya dibaca sebagai sinyal adopsi pada ekosistem mereka, bukan gambaran seluruh pekerja.

Contohnya bisa ditemukan di beberapa bidang:

  • Teknik: menganalisis log, mencari kemungkinan penyebab error, dan menyiapkan perubahan kode untuk ditinjau.
  • Operasional: menggabungkan data penjualan, tiket pelanggan, dan stok untuk menemukan masalah yang perlu diprioritaskan.
  • Keuangan: memeriksa transaksi yang tidak biasa lalu membuat daftar kasus yang perlu diperiksa manusia.
  • Riset: mencari dokumen, membandingkan temuan, menjalankan eksperimen, dan menyusun laporan awal.

OpenAI juga melaporkan bahwa penggunaan agent berkembang di luar tim teknis. Departemen seperti legal, finance, dan recruiting disebut mulai memakai Codex sebagai alat utama untuk sebagian pekerjaan mereka. Fakta ini menarik bukan karena semua pekerjaan akan segera digantikan, melainkan karena batas antara pekerjaan “teknis” dan “nonteknis” mulai lebih cair.

Masalahnya bukan hanya apakah agent pintar

Ketika AI hanya menghasilkan teks, kesalahan biasanya masih terlihat sebagai jawaban yang keliru. Ketika AI diberi akses ke sistem, kesalahan dapat berubah menjadi tindakan: mengirim email, mengubah data, membuka tiket, menjalankan deployment, atau membagikan dokumen ke tempat yang salah.

Itulah mengapa agent sebaiknya diperlakukan seperti rekan kerja junior yang cepat, bukan seperti mesin yang selalu benar. Ia mampu melakukan banyak langkah, tetapi belum tentu memahami konsekuensi bisnis, batas kewenangan, atau konteks yang tidak tertulis dalam sistem.

Semakin besar kemampuan agent untuk bertindak, semakin penting manusia menentukan apa yang tidak boleh dilakukan agent.

Risiko lain adalah kesalahan yang tampak masuk akal. Agent bisa membuat analisis dengan struktur yang rapi, tetapi memakai data yang tidak lengkap. Ia bisa menemukan pola dalam dashboard, tetapi salah memahami definisi metrik. Bahkan ketika akses data sudah dibatasi, hasilnya tetap perlu diperiksa karena izin akses tidak otomatis menjamin interpretasi yang benar.

Tren baru: evaluasi dilakukan saat AI bekerja

Perkembangan lain yang patut diperhatikan adalah meningkatnya perhatian pada evaluasi independen. Pada 18 September 2026, Anthropic mengumumkan kerja sama dengan Accenture untuk melakukan evaluasi dan red-teaming terhadap model AI. Tujuannya bukan hanya menguji kemampuan model di laboratorium, tetapi juga melihat bagaimana sistem berperilaku ketika digunakan dalam lingkungan kerja nyata.

Menurut Anthropic, evaluator independen dapat membantu membuat klaim keselamatan lebih mudah diverifikasi, meskipun tanggung jawab tetap berada pada perusahaan pembuat model. Ini menunjukkan pergeseran penting: pengujian AI tidak cukup dilakukan melalui beberapa pertanyaan contoh. Sistem perlu diuji dalam kondisi yang menyerupai penggunaan sebenarnya, termasuk akses data, alat, konflik instruksi, dan kemungkinan pemulihan ketika terjadi kesalahan.

Apa artinya bagi kita?

Bagi pengguna biasa, AI agent mungkin belum langsung mengambil alih pekerjaan sehari-hari. Namun pola kerjanya sudah bisa mulai dipakai untuk tugas berisiko rendah, seperti merapikan dokumen, membandingkan beberapa sumber, membuat draf laporan, atau mengubah data mentah menjadi daftar tindakan.

Bagi tim dan perusahaan, pertanyaan yang lebih penting bukan “agent mana yang paling pintar?”, melainkan:

  • Data apa yang boleh dibaca oleh agent?
  • Tindakan apa yang hanya boleh disiapkan, tetapi tidak boleh dieksekusi otomatis?
  • Kapan manusia wajib menyetujui hasil?
  • Bagaimana cara melacak sumber data, keputusan, dan perubahan yang dibuat agent?
  • Apa prosedur pemulihan jika agent mengambil langkah yang keliru?

OpenAI memberi contoh lain melalui Data agent di ChatGPT Work, yang dapat menghubungkan data perusahaan, menyelidiki perubahan metrik, membuat dashboard, dan mengusulkan tindakan melalui alat yang terhubung. Sistem seperti ini menunjukkan manfaat nyata agent, tetapi juga memperlihatkan mengapa definisi metrik, aturan akses, dan sumber data tepercaya harus disiapkan lebih dulu.

Yang bisa dilakukan sekarang

  1. Mulai dari tugas yang bisa dibatalkan. Pilih pekerjaan seperti membuat draf, mengelompokkan data, atau menyusun rekomendasi. Hindari memberi akses langsung ke pembayaran, penghapusan data, dan komunikasi eksternal.
  2. Pisahkan membaca dan bertindak. Biarkan agent menganalisis data terlebih dahulu. Tindakan nyata sebaiknya menunggu persetujuan manusia.
  3. Gunakan lingkungan terbatas. Untuk eksperimen teknis, pakai sandbox atau akun khusus dengan izin minimum. Jangan langsung memberikan akses administrator.
  4. Simpan jejak pekerjaan. Catat input, alat yang digunakan, perubahan yang dibuat, dan alasan persetujuan. Log ini penting saat hasil perlu diaudit.
  5. Uji dengan kasus gagal. Berikan data yang tidak lengkap, instruksi yang bertentangan, dan kondisi akses ditolak. Agent yang baik bukan hanya yang berhasil saat semuanya berjalan normal, tetapi juga yang berhenti dengan aman ketika ragu.

AI agent memang dapat menghemat waktu, terutama untuk pekerjaan yang panjang dan berulang. Namun nilai sebenarnya tidak datang dari membiarkan agent bekerja tanpa pengawasan. Nilai itu muncul ketika manusia merancang batas yang jelas, menyediakan konteks yang benar, dan menempatkan pemeriksaan pada titik yang tepat.

Jadi, keterampilan baru dalam memakai AI bukan sekadar menulis prompt yang panjang. Yang lebih penting adalah merancang pekerjaan: menentukan tujuan, akses, batas tindakan, bukti keberhasilan, dan jalur pemulihan. Di situlah perbedaan antara otomasi yang membantu dan otomasi yang menciptakan masalah.

Sumber & bacaan lebih lanjut

Jelajahi juga

– Rio Yotto @rioyotto