Observabilitas AI
Temukan di: Observabilitas AI di sidebar — opt-in via flag dev.
Pernah dengar kalimat seperti ini?
- "Copilot AI memberi jawaban aneh. Apa yang sebenarnya ia lakukan?"
- "Apakah kami membakar token untuk kueri yang tidak ke mana-mana?"
- "Apakah retrieval RAG benar-benar membantu, atau model mengabaikannya?"
Anda tidak bisa memperbaiki AI yang tidak bisa Anda lihat.
Masalahnya
Fitur AI adalah kotak hitam. Saat jawaban meleset, tidak ada jejak model mana yang berjalan, apa yang diambil, atau berapa token dibakar. Biaya meleset, kualitas turun diam-diam, dan tidak ada cara mengevaluasi perubahan.
Apa yang Dilakukan Observabilitas AI OpexMX
Menangkap trace untuk setiap eksekusi AI — model, status, durasi, ronde, panggilan tool (dengan argumen, waktu, dan ringkasan hasil), penggunaan token, dan snapshot pesan — sehingga setiap fitur dapat diperiksa dan dievaluasi.
Trace Per Eksekusi
Setiap eksekusi agen menjadi baris ai_trace: feature, model, status, durationMs, rounds, daftar toolCalls terstruktur, tokenUsage (prompt + completion), snapshot pesan terbaru, respons, dan error apa pun.
Penandaan RAG Otomatis
Eksekusi diklasifikasikan berdasarkan fitur secara otomatis — dan ditandai ulang dari copilot ke rag saat berkonsultasi dengan manual, sehingga Anda bisa membedakan jawaban berbasis retrieval sekilas.
Pipeline Evaluasi
Trace berfungsi ganda sebagai fixture evaluasi. Skor berdasarkan fitur dan scorer, dan amati tren lintas eksekusi — sehingga perubahan model atau prompt terukur, bukan firasat.
Opt-In Secara Desain
Penampil trace mati secara default di setiap tenant — aktifkan dengan flag dev saat ingin memeriksa. Penangkapan sendiri best-effort dan tidak pernah melempar ke fitur yang memakainya.
Cara Kerjanya
- Pengguna memicu fitur AI (copilot, RAG, autocomplete).
- Kolektor mengakumulasi span: panggilan model, setiap panggilan tool, token.
- Saat selesai, trace di-flush ke penyimpanan (best-effort).
- Buka penampil (saat diaktifkan) untuk memeriksa eksekusi apa pun.
- Skor eksekusi dari waktu ke waktu untuk mengukur kualitas.
Siapa yang Menggunakan Ini?
| Peran | Yang Mereka Pedulikan |
|---|---|
| AI / Produk | Apa yang model sebenarnya lakukan, dan mengapa |
| Pemilik biaya | Pengeluaran token per fitur |
| Keandalan | Kegagalan, retry, eksekusi lambat |
| Evaluasi / QA | Tren skor lintas perubahan |
Tips Pro
- Nyalakan penampil saat men-debug jawaban buruk tertentu, lalu matikan.
- Kelompokkan trace per fitur untuk menemukan jalur paling berisik dan mahal.
- Pakai eval run sebelum dan sesudah perubahan prompt/model — buktikan deltanya.
- Awasi penggunaan token, bukan hanya ketepatan — murah-dan-benar menang.
Integrasi
- Copilot AI / RAG: setiap eksekusi copilot dan retrieval ditrace
- Autocomplete / fill-AI: eksekusi jalur cepat juga ditangkap
- Manual / Pusat Pengetahuan: retrieval RAG muncul di span panggilan tool