Commit Graph

5 Commits

Author SHA1 Message Date
bilalgursen
080dcc9909 test(eval): sohbet eval verisi ve altyapısı güncellendi (iş 6) [KARAR]
- s104/s105: havuz düzeltmelerinden (B2) sonra öncül değişti; soru ve beklenti yeniden yazıldı.
- s084: icermemeli 'garanti' sorumluluk reddine takılıyordu; daraltıldı.
- s018/s033/s039/s048: kabul edilebilir cevapta araç şartı kaldırıldı (04 raporu §H).
- s088: adın kabul edilmesi metin kontrolüyle yakalanır.
- Kilitli (paketsiz) senaryoda Jev hakem bağlamına ürün bilgisi eklendi (299 TL, /paket yanlış alarmı).
- Paketsiz liste özeti kırpması danisman-prompt.ts'e taşındı (sohbetListeOzeti); route.ts ve eval aynı fonksiyonu kullanır, kopya kalktı. Davranış aynı.
- --tekrar N, tutarlılık özeti, ortalama araç çağrısı ve soru başı maliyet eklendi.
- Vaat regex'i 'AIS'e girersin', 'sınava girersin' cümlelerine takılmıyor.

Co-Authored-By: Claude Fable 5.1 <noreply@anthropic.com>
2026-10-05 08:14:51 +03:00
bilalgursen
e06c486b1a test(eval): profil beklentileri havuz düzeltmeleri sonrası davranışa göre yeniden üretildi
- 22 profilin beklenen değeri (gevşetme, minAday, hedef) B1/B2/B3/B5/B8
  sonrası gerçek havuzOlustur() çıktısına eşitlendi; "liste-24-alti"
  etiketi kalktı, düzelen bugların supheli kayıtları temizlendi.
- robot.ts: "alan-ilsiz-gevsedi" değişmezi artık yalnız alanda adayın
  yazabileceği 24+ program varken ihlal sayar (a07: baraj yüzünden alanda
  1 program kalıyor, gevşetme meşru; beklenti hatasıydı).

Önce: pnpm eval:robot 22 temiz / 18 ihlalli, çıkış 1.
Sonra: 40 temiz / 0 ihlalli, çıkış 0.

Co-Authored-By: Claude Fable 5.1 <noreply@anthropic.com>
2026-10-05 08:12:59 +03:00
bilalgursen
065a9c102d feat(eval): tercih robotu ve danışman sohbeti için tekrar koşulabilir eval + ilk taban çizgisi
- scripts/eval/robot.ts: 40 profilde modelsiz havuz değişmezleri (CI, çıkış kodu) ve
  --model ile gerçek liste üretimi denetimi (şema, havuz-dışı, yasak ifade, il
  çelişkisi, sayı tutarlılığı, Jev gerekçe grubu, gecikme, maliyet)
- scripts/eval/sohbet.ts: 112 soru gerçek danismanAkisi ile; araç kuralları, metin
  kontrolü, sayı kaynağı, vaat regex'i, Jev danışman grubu
- scripts/eval/ortak.ts: kullanım ölçümü, Jev istemcisi, kod denetimleri
- package.json: eval:robot, eval:sohbet
- İlk koşu sonuçları ve rapor (04-eval-sonuclari.md)

Co-Authored-By: Claude Fable 5.1 <noreply@anthropic.com>
2026-10-05 01:34:11 +03:00
bilalgursen
d9badeedfa docs(gece): eval profil matrisi + danışman soru seti (40 profil, 112 soru)
scripts/eval/profiller.ts: sihirbaz girdi şemasıyla birebir 40 profil ve
112 sohbet sorusu; beklenen havuz/hedef değerleri gerçek yokatlas.db
üzerinde havuzOlustur() koşturularak okundu (40/40 eşleşti).
docs/gece-vardiyasi/2026-10-05/02-profil-matrisi.md: kapsam tablosu,
kanıt, 16 bug adayı (dosya:satır) ve kapsanamayanlar.

Co-Authored-By: Claude Fable 5.1 <noreply@anthropic.com>
2026-10-05 01:08:07 +03:00
bilalgursen
5e3f72e2be docs(gece): Jev en iyi pratikler raporu + eval soru seti
TypeSafe belgeleri okundu, 38 sentetik çağrıyla 8 soruluk set doğrulandı.
src/ altına dokunulmadı.

Co-Authored-By: Claude Fable 5.1 <noreply@anthropic.com>
2026-10-05 00:54:47 +03:00