Langsung ke konten

Gaya prompt muncul di tagihan Anda

Diperbarui September 1, 2026 · pertama terbit September 1, 2026

Jawaban singkat: Prompt tumbuh seperti berkas konfigurasi. Seseorang menambahkan instruksi untuk memperbaiki satu mode kegagalan. Orang lain menambahkan contoh. Orang ketiga menambahkan paragraf yang menjelaskan...

Prompt tumbuh seperti berkas konfigurasi. Seseorang menambahkan instruksi untuk memperbaiki satu mode kegagalan. Orang lain menambahkan contoh. Orang ketiga menambahkan paragraf yang menjelaskan mengapa instruksi kedua penting. Tidak ada yang pernah dihapus, karena menghapusnya mungkin memunculkan kembali bug yang tidak bisa direproduksi siapa pun. Enam bulan kemudian, system prompt sudah tiga ribu token dan tidak ada yang bisa menyebutkan dua ratus di antaranya yang benar-benar menopang hasil.

Mengapa biayanya menumpuk

Berbeda dengan output, yang bervariasi mengikuti tugas, overhead prompt dibayar pada setiap permintaan, sama persis, selamanya. Seribu token yang terbuang pada satu fitur yang melayani sepuluh juta panggilan per bulan berarti sepuluh miliar token per bulan hanya untuk format.

Dalam percakapan multi-giliran keadaannya lebih buruk: system prompt dikirim ulang di setiap giliran, jadi biayanya mengikuti jumlah giliran, bukan jumlah permintaan. Dan dalam loop agen, ketika satu tindakan pengguna bisa memicu belasan panggilan model, preambel yang gemuk itu ditagihkan belasan kali untuk satu pekerjaan.

Apa yang sebenarnya boros

Bukan sopan santun, yang hanya beberapa token dan kadang justru membantu kepatuhan. Bobot sebenarnya ada pada: instruksi berlebih yang menyatakan aturan yang sama tiga kali, boilerplate defensif yang ditambahkan untuk generasi model yang sudah tidak membutuhkannya, contoh yang menduplikasi alih-alih mencakup kasus yang berbeda, dan penjelasan yang ditujukan kepada pembaca manusia dari file prompt, bukan kepada model.

Kategori ketiga adalah yang terbesar dalam praktik. Few-shot example mahal per token, dan tim jarang meninjau apakah lima contoh benar-benar bekerja, padahal dua saja sudah cukup.

Perlakukan prompt sebagai kode dengan anggaran

Ukur overhead prompt tetap sebagai porsi dari rata-rata ukuran permintaan. Jika lebih dari separuh, itu masalah biaya, bukan soal gaya. Letakkan bagian yang stabil di awal agar cache berlaku, sehingga sisa bloat jauh lebih murah tanpa menghapus apa pun. Lalu jalankan ablasi: hapus satu blok, jalankan eval Anda, dan simpan penghapusan jika kualitasnya tetap. Memangkas prompt tanpa rangkaian eval adalah tebakan, dan mode kegagalannya — regresi kualitas yang ditemukan pelanggan — lebih mahal daripada token yang dihemat.

Terkait

Terkait


Ingin menerapkannya pada stack Anda? Bawa tagihan penyedia, log gateway, dan alur kerja utama; kami akan memetakan pendorong biaya dan jalur penghematan. Pesan audit gratis →

Kembali ke finopsllm.com