Skip to content

Observabilitas AI | Dokumentasi OpexMX

Trace per eksekusi untuk setiap fitur AI — model, token, panggilan tool, durasi — dengan skor evaluasi. Opt-in.

Diperbarui

Observabilitas AI

Temukan di: Observabilitas AI di sidebar — opt-in via flag dev.

Pernah dengar kalimat seperti ini?

  • "Copilot AI memberi jawaban aneh. Apa yang sebenarnya ia lakukan?"
  • "Apakah kami membakar token untuk kueri yang tidak ke mana-mana?"
  • "Apakah retrieval RAG benar-benar membantu, atau model mengabaikannya?"

Anda tidak bisa memperbaiki AI yang tidak bisa Anda lihat.


Masalahnya

Fitur AI adalah kotak hitam. Saat jawaban meleset, tidak ada jejak model mana yang berjalan, apa yang diambil, atau berapa token dibakar. Biaya meleset, kualitas turun diam-diam, dan tidak ada cara mengevaluasi perubahan.

Apa yang Dilakukan Observabilitas AI OpexMX

Menangkap trace untuk setiap eksekusi AI — model, status, durasi, ronde, panggilan tool (dengan argumen, waktu, dan ringkasan hasil), penggunaan token, dan snapshot pesan — sehingga setiap fitur dapat diperiksa dan dievaluasi.

Trace Per Eksekusi

Setiap eksekusi agen menjadi baris ai_trace: feature, model, status, durationMs, rounds, daftar toolCalls terstruktur, tokenUsage (prompt + completion), snapshot pesan terbaru, respons, dan error apa pun.

Penandaan RAG Otomatis

Eksekusi diklasifikasikan berdasarkan fitur secara otomatis — dan ditandai ulang dari copilot ke rag saat berkonsultasi dengan manual, sehingga Anda bisa membedakan jawaban berbasis retrieval sekilas.

Pipeline Evaluasi

Trace berfungsi ganda sebagai fixture evaluasi. Skor berdasarkan fitur dan scorer, dan amati tren lintas eksekusi — sehingga perubahan model atau prompt terukur, bukan firasat.

Opt-In Secara Desain

Penampil trace mati secara default di setiap tenant — aktifkan dengan flag dev saat ingin memeriksa. Penangkapan sendiri best-effort dan tidak pernah melempar ke fitur yang memakainya.

Cara Kerjanya

  1. Pengguna memicu fitur AI (copilot, RAG, autocomplete).
  2. Kolektor mengakumulasi span: panggilan model, setiap panggilan tool, token.
  3. Saat selesai, trace di-flush ke penyimpanan (best-effort).
  4. Buka penampil (saat diaktifkan) untuk memeriksa eksekusi apa pun.
  5. Skor eksekusi dari waktu ke waktu untuk mengukur kualitas.

Siapa yang Menggunakan Ini?

PeranYang Mereka Pedulikan
AI / ProdukApa yang model sebenarnya lakukan, dan mengapa
Pemilik biayaPengeluaran token per fitur
KeandalanKegagalan, retry, eksekusi lambat
Evaluasi / QATren skor lintas perubahan

Tips Pro

  • Nyalakan penampil saat men-debug jawaban buruk tertentu, lalu matikan.
  • Kelompokkan trace per fitur untuk menemukan jalur paling berisik dan mahal.
  • Pakai eval run sebelum dan sesudah perubahan prompt/model — buktikan deltanya.
  • Awasi penggunaan token, bukan hanya ketepatan — murah-dan-benar menang.

Integrasi

  • Copilot AI / RAG: setiap eksekusi copilot dan retrieval ditrace
  • Autocomplete / fill-AI: eksekusi jalur cepat juga ditangkap
  • Manual / Pusat Pengetahuan: retrieval RAG muncul di span panggilan tool