Pencarian web menjadi pusat biaya agen
Diperbarui September 10, 2026 · pertama terbit September 10, 2026
Agen bergerak dari pengetahuan statis ke riset web langsung, dan itu mengubah model biayanya. Satu permintaan pengguna kini bisa memicu beberapa pencarian, satu panggilan model untuk menafsirkan setiap hasil, percobaan ulang tool, dan sintesis akhir. Lapisan pencarian tidak lagi menjadi infrastruktur yang tak terlihat; ia adalah bagian tugas yang diukur dan ditagih secara terpisah.
Amazon Bedrock AgentCore, misalnya, mendokumentasikan Web Search sebagai kapabilitas berbasis penggunaan dengan harga $7 per 1.000 kueri. Harga pastinya bervariasi menurut penyedia dan produk, tetapi pelajaran FinOps-nya berlaku umum: hitung pemanggilan tool sebagai pekerjaan yang dapat ditagih, bersama token input dan output. Lihat pengumuman AWS untuk contoh terkini.
Satu prompt bisa menjadi banyak pencarian
Amplifikasi pencarian berasal dari perencanaan. Agen dapat menulis ulang pertanyaan, mencari di banyak sumber, mengikuti satu hasil, mencoba ulang saat timeout, dan mencari lagi setelah menemukan bukti yang saling bertentangan. Jika aplikasi hanya mencatat prompt asli pengguna, tim keuangan melihat fitur dengan volume rendah, sementara penyedia melihat beban tool yang bervolume tinggi.
Catat ID tugas induk, penyedia pencarian, jumlah kueri, jumlah pengambilan hasil, jumlah percobaan ulang, dan apakah hasil mengubah jawaban akhir. Lalu hitung biaya pencarian per tugas berhasil. Pencarian yang tidak pernah berkontribusi pada jawaban yang berguna adalah kandidat untuk perubahan kebijakan, bukan sekadar baris biaya yang diterima begitu saja.
Kendalikan anggaran pencarian
- Tetapkan batas maksimum kueri pencarian per tugas dan per tingkat pengguna.
- Gunakan laluan pertama yang lebih murah untuk penemuan, lalu sisihkan riset mendalam untuk tugas bernilai tinggi.
- Cache kueri yang stabil dan normalkan perbedaan kata yang tidak berarti.
- Berhenti setelah ambang bukti terpenuhi, alih-alih membiarkan perencana terus menjelajah.
- Buat percobaan ulang eksponensial dan batasi secara terpisah dari percobaan ulang model.
Ukur kesegaran data terhadap pengeluaran
Kesegaran data bernilai hanya jika mengubah keputusan. Bandingkan kualitas jawaban dan keberhasilan tugas pada kedalaman pencarian yang berbeda: tanpa pencarian, satu pencarian, dan pencarian berganda yang dibatasi. Sebagian alur kerja memang membutuhkan informasi terkini; yang lain membayar pengambilan berulang untuk fakta yang berubah pelan.
Laporkan tiga angka bersama: biaya model, biaya pencarian, dan biaya per tugas berhasil. Ini mencegah model yang lebih murah tampak efisien padahal ia mengimbangi dengan jumlah pencarian berbayar yang besar. Ini juga memberi tim produk cara yang dapat dipertanggungjawabkan untuk memutuskan kapan grounding web langsung sepadan dengan premi biayanya.
Terkait
Terkait
Ingin menerapkannya pada stack Anda? Bawa tagihan penyedia, log gateway, dan alur kerja utama; kami akan memetakan pendorong biaya dan jalur penghematan. Pesan audit gratis →