Skip to content

Bagian 8 — Observability & Evaluation

Ada pertanyaan yang belum bisa kamu jawab tentang semua yang dibangun sampai sini: apakah agent-mu benar-benar bagus, atau hanya terasa bagus?

Perangkat lunak biasa punya jawaban yang mudah. Tes berhasil atau gagal. Fungsi mengembalikan nilai yang benar atau tidak. Tapi keluaran AI bersifat non-deterministik — masukan yang sama bisa menghasilkan keluaran yang berbeda. Kamu tidak bisa menulis expect(jawaban).toBe('...') untuk agent.

Bagian ini tentang dua kemampuan yang menjawab kekosongan itu dari arah berbeda.

Melihat, dan menilai

Observability menjawab: apa yang sebenarnya terjadi? Saat agent memberi jawaban aneh, kamu perlu melihat tool apa yang ia panggil, argumen apa yang ia kirim, dan berapa lama tiap langkah berlangsung.

Evaluation menjawab: seberapa baik hasilnya? Alih-alih lulus atau gagal, kamu mendapat skor — angka yang biasanya antara 0 dan 1 — yang bisa dilacak dari waktu ke waktu dan dibandingkan antar versi.

ObservabilityEvaluation
PertanyaannyaApa yang terjadi?Seberapa baik?
Bentuk jawabannyaTrace, log, metrikSkor
Dipakai saatAda yang salahSebelum dan sesudah perubahan
AnaloginyaDebuggerTes regresi

Keduanya saling melengkapi. Skor memberitahumu bahwa ada penurunan mutu; trace memberitahumu kenapa.

Kenapa ini bukan bagian opsional

Godaan terbesar saat membangun agent adalah menilai kualitas dari kesan. Kamu mencoba lima pertanyaan, jawabannya bagus, dan kamu menyimpulkan agent-nya bagus.

Masalahnya, lima pertanyaan yang kamu pilih sendiri hampir selalu terlalu optimistis — kamu tanpa sadar memilih pertanyaan yang kamu tahu bisa dijawab. Dan begitu kamu mengubah instruksi minggu depan, tidak ada cara mengetahui apakah perubahan itu memperbaiki atau merusak sesuatu.

Kalau kamu mengerjakan latihan di 5.3 — menyiapkan sepuluh pertanyaan uji dengan jawaban yang diketahui — kamu sudah melakukan versi manual dari apa yang diotomatiskan bagian ini.

Bab di bagian ini

BabIsi
8.1Tracing: melihat apa yang sebenarnya dilakukan agent
8.2Logging terstruktur dan metrik
8.3Scorer bawaan dan live evaluation
8.4Menulis scorer sendiri dan menjalankannya di CI

Prasyarat bagian ini

  • Bagian 7 selesai
  • Storage terpasang — trace, log, dan skor semuanya butuh tempat tinggal
  • Paket @mastra/evals akan dipasang di bab 8.3

Lanjut ke mana

Mulai dari 8.1 Tracing.

Materi belajar mandiri. Bukan dokumentasi resmi Mastra.