Commit Graph

3 Commits

Author SHA1 Message Date
bilalgursen
3128b01e26 fix(liste): model seçimi önce kodla onarılsın; ikinci çağrı ve zaman aşımı azalsın [KARAR]
Kök neden 2 (04-eval-sonuclari): 10/40 listede ikinci model çağrısı,
3/40'ta 60 sn zaman aşımı.

rapor.ts
- secimiOnar: yinelenen ve havuz-dışı kimlik atılır, yanlış listeye konan
  program havuzdaki gerçek dilimine taşınır, hedefi aşan dilim kırpılır,
  eksik satır havuzdan deterministik sırayla (önce adayın seçimine uyanlar,
  sonra sıraya yakınlık) tamamlanır; tamamlanan satırın gerekçesi şablondur.
  İkinci model çağrısı yalnız çıktı şemaya uymazsa ya da modelin seçiminin
  yarısından azı kullanılabiliyorsa yapılır. Havuz-dışı koruması aynen durur.
- Prompt: havuz dilim başına üç dizi (hayal/dengeli/guvenli) olarak gider,
  üçüncü listenin tel adı `guvenli` (iç anahtar `garanti` kalır); vaat ve
  rakam yasağı netleşti; adayın serbest metni etiket içinde veri olarak girer.
- İlk üretimde zaman aşımı: liste havuzdan kodla kurulur, üst metin bunu
  söyler (ZAMAN_ASIMINDA_KODLA_KUR). KREDİ: bu yolda üretim başarılı sayılır,
  iade yapılmaz. Revizyonda zaman aşımı eskisi gibi hata + iade.
- raporUretAyrintili + RaporTani: onarım/şablon/çağrı gözlemi (eval ve log).

cagri.ts
- Üst sağlayıcı gözlemi (CagriGozlemi) ve tepkisel dışlama: reasoning kapalı
  istendiği hâlde düşünme token'ı üreten üst sağlayıcı 6 saat
  provider.ignore ile atlanır. Ölçüm: 16 üst sağlayıcıdan yalnız AtlasCloud
  isteğe uymuyor (4.000 token'ın 3.999'u düşünme, ~50 sn, içerik yarım);
  zaman aşımlarının ve "iki denemede başarısız" hatasının kaynağı buydu.

robot.ts: tanılı API, yeni tel şeması, onarım/şablon/üst sağlayıcı özeti,
"Kıbrıs'ta" il çelişkisi yanlış alarmı.

Önce → sonra (40 profil, gerçek model; ayrıntı 07-liste-duzeltmeleri.md):
üretilen liste 37 → 40, zaman aşımı 3 → 0, ikinci çağrı 10 → 1.

Co-Authored-By: Claude Fable 5.1 <noreply@anthropic.com>
2026-10-05 08:49:01 +03:00
bilalgursen
e06c486b1a test(eval): profil beklentileri havuz düzeltmeleri sonrası davranışa göre yeniden üretildi
- 22 profilin beklenen değeri (gevşetme, minAday, hedef) B1/B2/B3/B5/B8
  sonrası gerçek havuzOlustur() çıktısına eşitlendi; "liste-24-alti"
  etiketi kalktı, düzelen bugların supheli kayıtları temizlendi.
- robot.ts: "alan-ilsiz-gevsedi" değişmezi artık yalnız alanda adayın
  yazabileceği 24+ program varken ihlal sayar (a07: baraj yüzünden alanda
  1 program kalıyor, gevşetme meşru; beklenti hatasıydı).

Önce: pnpm eval:robot 22 temiz / 18 ihlalli, çıkış 1.
Sonra: 40 temiz / 0 ihlalli, çıkış 0.

Co-Authored-By: Claude Fable 5.1 <noreply@anthropic.com>
2026-10-05 08:12:59 +03:00
bilalgursen
065a9c102d feat(eval): tercih robotu ve danışman sohbeti için tekrar koşulabilir eval + ilk taban çizgisi
- scripts/eval/robot.ts: 40 profilde modelsiz havuz değişmezleri (CI, çıkış kodu) ve
  --model ile gerçek liste üretimi denetimi (şema, havuz-dışı, yasak ifade, il
  çelişkisi, sayı tutarlılığı, Jev gerekçe grubu, gecikme, maliyet)
- scripts/eval/sohbet.ts: 112 soru gerçek danismanAkisi ile; araç kuralları, metin
  kontrolü, sayı kaynağı, vaat regex'i, Jev danışman grubu
- scripts/eval/ortak.ts: kullanım ölçümü, Jev istemcisi, kod denetimleri
- package.json: eval:robot, eval:sohbet
- İlk koşu sonuçları ve rapor (04-eval-sonuclari.md)

Co-Authored-By: Claude Fable 5.1 <noreply@anthropic.com>
2026-10-05 01:34:11 +03:00