Cara Memangkas Biaya Token Agen AI Anda hingga 99%

Indeks repositori Anda ke dalam grafik pengetahuan agar agen Anda tidak lagi melakukan grepping: sekitar 3.400 token dibandingkan 412.000 untuk lima kueri struktural.

INEZA Felin-Michel

INEZA Felin-Michel

1 September 2026

Cara Memangkas Biaya Token Agen AI Anda hingga 99%

Apidog untuk Perusahaan

Penerapan On-Premises

SSO & RBAC

Sesuai SOC 2

Jelajahi Apidog Enterprise

Intinya: codebase-memory-mcp mengindeks repositori Anda ke dalam graf pengetahuan persisten sehingga agen pengodean Anda menjawab pertanyaan struktural dari graf alih-alih melakukan grepping dan membaca jalannya ke sana. Proyek ini mengukur lima kueri struktural dengan perkiraan 3.400 token melalui graf dibandingkan dengan perkiraan 412.000 token melalui penjelajahan file-per-file, sebuah pengurangan 99,2%. Ditulis dalam C, dikirimkan sebagai biner tunggal native tanpa runtime dan tanpa kunci API, mencakup lebih dari 160 bahasa, dan berjalan sepenuhnya di mesin Anda. 41.536 bintang per 1 September 2026, berlisensi MIT. Jika Anda menginstal satu hal dari gelombang alat agen 2026, pastikan itu yang ini.

Ini adalah tinjauan mendalam tentang satu alat dari rangkuman kami tentang lima alat agen AI open source yang layak diinstal pada tahun 2026.

Tanyakan agen Anda di mana sebuah fungsi dipanggil dan perhatikan apa yang terjadi. Ia melakukan grep. Ia membaca tiga file. Ia melakukan grep lagi dengan pola yang berbeda. Ia membaca empat file lagi. Akhirnya ia menjawab, dengan benar, setelah menghabiskan puluhan ribu token untuk mengisi konteksnya dengan kode sumber yang akan ia lupakan begitu sesi berakhir.

Kemudian Anda bertanya lagi dan ia melakukan hal yang sama lagi.

Lingkaran itulah yang menghabiskan sebagian besar batas penggunaan Anda dalam sesi yang panjang, dan itu juga mengapa kualitas jawaban menurun selama sore hari: jendela konteks yang penuh dengan konten file memiliki lebih sedikit ruang untuk penalaran. codebase-memory-mcp menyerang kedua masalah tersebut dengan langkah yang sama.

Apa yang Dilakukannya

Ia menguraikan repositori Anda menjadi graf pengetahuan persisten yang berisi fungsi, kelas, rantai panggilan, rute HTTP, dan tautan lintas layanan, kemudian menjawab pertanyaan struktural dari graf tersebut.

Visualisasi 3D dari graf pengetahuan yang menunjukkan node dan edge yang merepresentasikan entitas kode dan hubungannya.

Parsing berjalan melalui analisis AST tree-sitter di lebih dari 160 bahasa, dengan lapisan LSP hibrida yang menambahkan resolusi tipe semantik untuk kelompok inti yang terhitung sepuluh dalam lencana README: Python, keluarga TypeScript dan JavaScript termasuk JSX dan TSX, PHP, C#, Go, C, C++, Java, Kotlin, Rust, dan Perl. Perbedaan ini penting. Parsing AST memberi tahu Anda bahwa metode bernama `save` dipanggil; resolusi tipe memberi tahu Anda kelas mana yang dimilikinya.

Hasilnya diekspos sebagai 15 alat MCP yang mencakup pencarian, pelacakan rantai panggilan, gambaran arsitektur, analisis dampak, pemeriksaan cakupan indeks, kueri Cypher terhadap graf, deteksi kode mati, penautan HTTP lintas layanan, dan manajemen ADR. Klien mana pun yang berbicara Model Context Protocol dapat menggunakannya, dan proyek ini mencantumkan 45 antarmuka agen yang didukung termasuk Claude Code, Codex, Cursor, Windsurf, OpenCode, Gemini CLI, Aider, dan Kilocode.

Angka-angka

Dua set independen, dan keduanya layak dibaca dengan cermat.

Pengukuran proyek sendiri: lima kueri struktural mengonsumsi sekitar 3.400 token melalui graf dibandingkan sekitar 412.000 token melalui penjelajahan grep file-per-file. Itu adalah pengurangan 99,2%, atau sekitar 120 kali lebih sedikit token untuk jawaban yang sama.

Versi akademis ada dalam pracetak, Codebase-Memory: Tree-Sitter-Based Knowledge Graphs for LLM Code Exploration via MCP, dievaluasi di 31 repositori dunia nyata. Ini melaporkan kualitas jawaban 83%, 10 kali lebih sedikit token, dan 2,1 kali lebih sedikit panggilan alat dibandingkan penjelajahan file-per-file.

Selisih antara 120x dan 10x adalah bagian yang jujur. Angka 120x adalah lima kueri struktural, yang merupakan kasus terbaik graf, karena pertanyaan struktural adalah persis untuk apa graf itu. Angka 10x adalah campuran yang lebih luas di 31 repositori, yang lebih dekat dengan apa yang akan Anda lihat dalam penggunaan sehari-hari. Keduanya besar. Ambil 10x sebagai angka perencanaan Anda dan anggap apa pun yang lebih baik sebagai keuntungan.

Kecepatan adalah bagian lainnya. Mengindeks kernel Linux, 28 juta baris di 75.000 file, membutuhkan waktu tiga menit. Repositori rata-rata diindeks dalam hitungan milidetik. Kueri struktural kembali dalam waktu kurang dari satu milidetik. Pipa ini RAM-first dengan kompresi LZ4, SQLite dalam memori, dan pencocokan pola Aho-Corasick terpadu, dan memori dilepaskan setelah pengindeksan.

Menulisnya dalam C daripada TypeScript atau Python adalah alasan mengapa angka-angka tersebut ada, dan itu juga mengapa tidak ada runtime yang perlu diinstal.

Menginstalnya

macOS dan Linux:

curl -fsSL https://raw.githubusercontent.com/DeusData/codebase-memory-mcp/main/install.sh | bash

Windows, dengan langkah-langkah yang direkomendasikan proyek daripada satu baris buta:

Invoke-WebRequest -Uri https://raw.githubusercontent.com/DeusData/codebase-memory-mcp/main/install.ps1 -OutFile install.ps1
notepad install.ps1        # baca dulu
Unblock-File .\install.ps1
.\install.ps1

Pilihan termasuk --skip-config untuk biner saja tanpa pengaturan agen, dan --dir=<path> untuk lokasi kustom. Pemasang secara otomatis mendeteksi agen pengodean yang terinstal dan menulis entri MCP mereka yang terdokumentasi, ditambah instruksi, keterampilan, dan hook siklus hidup di mana klien mendukungnya. Di macOS, ia menghapus atribut karantina dan menandatangani biner secara ad-hoc, jadi tidak perlu pekerjaan xattr atau codesign manual.

Kemudian mulai ulang agen Anda dan perintahkan untuk mengindeks proyek.

Dua flag konfigurasi yang layak diatur pada hari pertama:

# indeks proyek baru secara otomatis pada koneksi pertama
codebase-memory-mcp config set auto_index true
codebase-memory-mcp config set auto_index_limit 50000

# visualisasi graf, dibangun di dalam biner
codebase-memory-mcp --ui=true --port=9749

UI di localhost:9749 merender graf pengetahuan dalam 3D. Ini benar-benar berguna untuk menemukan struktur yang tidak Anda ketahui ada di sana, dan ini adalah pemeriksaan kewarasan yang baik bahwa indeks mencakup apa yang Anda harapkan.

Jika Anda bekerja di banyak repositori, auto_watch false mencegah sesi mendaftarkan proyeknya ke pengawas latar belakang, dan watcher_enabled false mematikan thread polling sepenuhnya. Yang kedua ini dibaca sekali saat daemon dimulai, jadi hentikan daemon setelah mengubahnya.

Dua hal yang perlu diperiksa sebelum Anda menjalankannya

Keduanya didokumentasikan oleh proyek, yang merupakan pertanda baik, dan keduanya patut Anda perhatikan selama tiga puluh detik.

Microsoft Defender mungkin menandai biner rilis sebagai Trojan:Script/Wacatac.B!ml. Proyek ini mendokumentasikan ini sebagai false positive yang diketahui, mencatat bahwa biasanya 61 dari sekitar 62 mesin mengembalikan hasil bersih, dan menunjukkan bahwa keluarga deteksi yang sama mengenai GitHub CLI, llama.cpp, Godot, dan toolchain Go milik Microsoft sendiri. Setiap rilis dipindai di VirusTotal sebelum publikasi dan catatan rilis menautkan hasilnya. Itu adalah sikap yang lebih transparan daripada kebanyakan proyek, dan masalah yang mendasarinya adalah masalah heuristik yang terkenal dengan biner native kecil yang tidak ditandatangani.

Ia membaca basis kode Anda dan menulis ke file konfigurasi agen Anda. Itulah tugasnya, dan proyek mengatakannya dengan jelas alih-alih menyembunyikannya. Mitigasinya nyata: sumber lengkap tersedia di bawah MIT, rilis membawa OpenSSF Scorecard dan SLSA level 3 provenance, dan pemrosesan sepenuhnya lokal. Proyek ini juga menyatakan bahwa ia tidak membuat permintaan jaringan sendiri, tidak memeriksa pembaruan di latar belakang, dan tidak menghubungi 'rumah'. Pembaruan berjalan dari skrip instalasi yang ditempatkan di samping biner daripada dari dalam proses yang sedang berjalan, yang merupakan pilihan desain yang disengaja yang dijelaskan panjang lebar di README.

Respon yang tepat untuk keduanya sama: baca skrip instalasi sebelum Anda memasukkannya ke bash, dan verifikasi klaim hanya-lokal sendiri jika itu penting bagi Anda. Jumlah bintang yang banyak adalah popularitas, bukan audit.

Mengapa ini yang pertama kali harus diinstal

Setiap alat lain dalam gelombang agen saat ini mengubah alur kerja Anda. Persona mengubah cara Anda memberikan prompt. Worktree paralel mengubah cara Anda mengatur pekerjaan. Akses web mengubah apa yang Anda minta.

Yang satu ini tidak mengubah apa pun tentang cara Anda bekerja dan membuat setiap sesi lebih murah dan lebih baik. Tidak ada kebiasaan baru yang perlu dipelajari. Anda menginstalnya, mengindeks proyek, dan agen Anda berhenti menghabiskan konteks pada loop grep. Pada refactoring yang panjang, perbedaan antara mencapai batas Anda pada jam 2 siang dan menyelesaikan hari tidaklah kecil.

Efek kualitas adalah setengah bagian yang kurang dihargai. Agen yang menghabiskan 400.000 token untuk membaca file memiliki lebih sedikit ruang untuk benar-benar memikirkan masalah Anda, dan ingatannya tentang apa yang dibacanya di awal sesi menurun. Menjawab dari graf menjaga konteks tetap bebas. Dinamika yang sama berlaku untuk apa yang dikembalikan alat Anda ke dalam konteks itu, yang merupakan subjek dari jendela konteks respons alat agen, dan itu adalah kegagalan yang sama yang membuat respons API yang membengkak menjadi mahal dalam alur kerja agen.

Alat yang Sebenarnya Akan Anda Gunakan

Lima belas alat MCP terdengar banyak untuk dipelajari. Pada praktiknya Anda tidak mempelajari satupun, karena agen yang memilihnya. Yang patut diketahui adalah pertanyaan mana yang sekarang memiliki jawaban murah, sehingga Anda mulai menanyakannya.

Analisis dampak adalah yang paling bernilai dan paling sedikit digunakan. Sebelum mengubah tanda tangan fungsi, tanyakan apa yang akan rusak. Graf melacak setiap pemanggil di seluruh repositori dalam waktu kurang dari satu milidetik, di mana versi grep melewatkan dispatch dinamis dan menyerah pada apa pun yang tidak langsung. Ini mengubah “Saya pikir itu aman” menjadi sebuah daftar.

Pelacakan rantai panggilan menjawab bagaimana eksekusi benar-benar mencapai sepotong kode. Berguna pada repositori yang tidak dikenal dan jauh lebih baik daripada membaca ke atas melalui lima file dengan harapan menemukan titik masuk.

Gambaran umum arsitektur memberikan peta struktural tanpa agen membaca seluruh pohon. Inilah yang membuat onboarding ke basis kode yang tidak dikenal terasa berbeda, dan ini cocok dengan persona eksplorasi hanya-baca.

Deteksi kode mati menemukan apa yang tidak dipanggil oleh apa pun. Jalankan sebelum sprint pembersihan daripada memperdebatkannya.

Penautan HTTP lintas layanan melacak panggilan dalam satu layanan ke penangan di layanan lain. Pada basis kode layanan mikro, ini adalah perbedaan antara agen yang memahami satu repositori dan agen yang memahami sistem. Ini juga persis di mana celah kontrak di bawah muncul.

Kueri Cypher adalah jalan keluar. Ketika Anda menginginkan sesuatu yang spesifik yang tidak dicakup oleh alat lain, Anda dapat langsung mengueri graf.

Pergeseran praktisnya ada pada cara Anda memberikan prompt. Pertanyaan yang sebelumnya Anda hindari karena menghabiskan 50.000 token dan dua menit sekarang hampir gratis, jadi tanyakanlah. “Apa yang memanggil ini?” sebelum setiap refactor. “Seperti apa jalur permintaan untuk endpoint ini?” sebelum debugging. Alat ini mengubah ekonomi keingintahuan, yang lebih penting daripada fitur tunggal mana pun.

Apa yang Graf Tahu, dan Apa yang Tidak

Inilah batasnya, dan itu adalah batas yang tajam yang patut dipahami sebelum Anda terlalu mempercayai alat ini.

Graf dibangun dari kode Anda. Ia tahu apa kode Anda. Di antara 15 alat ada penautan HTTP lintas layanan, yang melacak panggilan dalam satu layanan ke penangan di layanan lain, dan itu adalah hal yang benar-benar berguna untuk diketahui agen.

Yang tidak bisa diberitahukannya adalah apa yang dikatakan kontrak. Ia tahu rute /v1/invoices/{id} ada dan fungsi mana yang melayaninya. Ia tidak tahu bahwa endpoint mengembalikan 409 dengan envelope error yang berbeda ketika kunci idempotensi digunakan kembali, bahwa bidang status memiliki tepat lima nilai valid, bahwa kursornya buram alih-alih offset, atau bahwa suatu bidang usang dan akan hilang kuartal depan. Tidak ada satupun yang dapat diturunkan dari sumber penangan, karena sebagian besar adalah kesepakatan daripada implementasi.

Jadi agen, sekarang dilengkapi dengan ingatan struktural yang sempurna, masih menebak kontrak. Ia menulis klien terhadap bentuk yang disimpulkan dan menguji terhadap mock yang ia ciptakan, dan semuanya hijau sampai staging.

Inilah mengapa Apidog dan alat seperti ini cocok bersama daripada tumpang tindih:

Ada simetri yang menyenangkan di dalamnya. codebase-memory-mcp ada karena membaca sumber untuk menjawab pertanyaan struktural itu mahal dan tidak dapat diandalkan. Hal yang sama berlaku untuk membaca sumber untuk menyimpulkan kontrak, dan jawabannya sama: indeks objek sekali, dalam bentuk yang dibangun untuk pertanyaan tersebut. Unduh Apidog jika agen Anda menulis klien API terhadap bentuk yang tidak pernah ditulis oleh siapa pun. Terkait: merancang skema alat API untuk agen dan apakah Anda masih memerlukan alat API di era agen AI.

Ingatan Kode Bukanlah Ingatan Pekerjaan

Batas kedua bersifat organisasional.

Indeks ini berada di direktori cache pada satu mesin, di bawah satu akun. Ini dibagikan di seluruh sesi Claude Code, Codex, dan OpenCode lokal Anda melalui daemon koordinasi, yang merupakan bagian rekayasa yang bagus, dan berhenti di tepi mesin itu.

Yang lebih penting, graf adalah ingatan basis kode, bukan ingatan pekerjaan. Ini bisa memberi tahu Anda bahwa `retry helper` memanggil klien pembayaran. Ini tidak bisa memberi tahu Anda mengapa `backoff` berubah di bulan Juli, siapa yang memutuskan itu, apa alternatifnya, atau apakah ada yang meninjaunya. Sejarah itu ada dalam sesi terminal yang sudah hilang.

Tim merasakan ini sebagai celah aneh: agen memiliki ingatan kode yang lebih baik daripada manusia mana pun di tim, dan tidak ada ingatan sama sekali tentang keputusan yang menghasilkannya.

Sharkly mencakup bagian lain dengan menjadikan tugas sebagai catatan yang tahan lama daripada prompt:

Sebuah dasbor yang menampilkan berbagai fitur manajemen proyek, termasuk tugas, sprint, dan integrasi kode.

Memori kode ditambah memori kerja adalah kombinasi. Satu alat memberikan agen Anda ingatan tentang repositori. Yang lain memberikan tim Anda ingatan tentang apa yang dilakukan agen di dalamnya.

FAQ

Apakah ini bekerja dengan Cursor, Codex, dan OpenCode, atau hanya Claude Code? Ini adalah server MCP, jadi klien MCP mana pun berfungsi. Proyek ini mencantumkan 45 antarmuka agen yang didukung dan pemasang secara otomatis mendeteksi apa yang Anda miliki. Jika Anda mempertimbangkan klien agen untuk pekerjaan API, lihat tinjauan kami tentang klien API di Cursor dan Copilot.

Apakah kode saya meninggalkan mesin saya? Tidak. Pemrosesan sepenuhnya lokal, dan proyek menyatakan bahwa ia tidak membuat permintaan jaringan sendiri dan tidak memeriksa pembaruan di latar belakang. Sumbernya adalah MIT jika Anda ingin memverifikasinya daripada mempercayainya begitu saja.

Apakah pengurangan token 99% realistis untuk repo saya? Angka 99,2% adalah lima kueri struktural, yang merupakan kasus terkuat graf. Angka yang ditinjau sejawat di 31 repositori adalah 10 kali lebih sedikit token dan 2,1 kali lebih sedikit panggilan alat. Rencanakan sekitar 10x. Pekerjaan yang banyak pertanyaan struktural akan mengalahkannya.

Seberapa besar repositori yang bisa ditanganinya? Kasus batas atas yang disebutkan adalah kernel Linux pada 28 juta baris dan 75.000 file dalam tiga menit. Batas auto-indeks default dapat dikonfigurasi pada 50.000 file. Repositori aplikasi biasa diindeks dalam hitungan milidetik.

Mengapa Defender menandainya? False positive machine-learning yang dikenal pada biner native kecil yang tidak ditandatangani. Proyek mendokumentasikannya, mencatat bahwa 61 dari sekitar 62 mesin mengembalikan hasil bersih, dan menautkan hasil VirusTotal per rilis. Keluarga deteksi yang sama menyerang GitHub CLI dan toolchain Go milik Microsoft sendiri.

Apakah ini menggantikan membaca kode? Untuk pertanyaan struktural, ya, dan itu sebagian besar yang ditanyakan agen. Untuk perilaku, kasus tepi, dan niat, tidak. Dan untuk apa yang dikembalikan API, Anda memerlukan spesifikasi daripada keduanya, yang merupakan argumen dalam apakah Anda masih memerlukan alat API di era agen AI.

Kesimpulan

Ini adalah alat yang paling tidak mencolok dalam gelombang agen 2026 dan yang memberikan pengembalian terbaik. Tidak ada perubahan alur kerja, tidak ada kebiasaan baru, biner native tunggal, dan pengurangan besaran order terukur dalam token yang dihabiskan agen Anda untuk menjawab pertanyaan yang seharusnya tidak perlu dicari dengan grep. Ini juga paling bermanfaat ketika beberapa agen berjalan sekaligus, seperti pada kasus Orca. Instal, indeks proyek Anda, atur auto_index, dan buka penampil graf sekali untuk melihat apa yang telah dibangunnya.

Kemudian pahami dengan jelas kedua batasnya. Graf mengetahui di mana kode Anda berada, bukan apa yang dijanjikan API Anda, dan celah itu adalah yang ditutup oleh Apidog dengan spesifikasi, mock, dan suite pengujian. Dan ia mengingat repositori, bukan pekerjaannya, yang ditutup oleh Sharkly dengan menjadikan tugas sebagai catatan alih-alih prompt.

Ingatan kode yang sempurna adalah fondasi yang kuat. Ini tidak sama dengan mengetahui apa yang benar atau apa yang telah diputuskan.

Mengembangkan API dengan Apidog

Apidog adalah alat pengembangan API yang membantu Anda mengembangkan API dengan lebih mudah dan efisien.