Kök neden 2 (04-eval-sonuclari): 10/40 listede ikinci model çağrısı,
3/40'ta 60 sn zaman aşımı.
rapor.ts
- secimiOnar: yinelenen ve havuz-dışı kimlik atılır, yanlış listeye konan
program havuzdaki gerçek dilimine taşınır, hedefi aşan dilim kırpılır,
eksik satır havuzdan deterministik sırayla (önce adayın seçimine uyanlar,
sonra sıraya yakınlık) tamamlanır; tamamlanan satırın gerekçesi şablondur.
İkinci model çağrısı yalnız çıktı şemaya uymazsa ya da modelin seçiminin
yarısından azı kullanılabiliyorsa yapılır. Havuz-dışı koruması aynen durur.
- Prompt: havuz dilim başına üç dizi (hayal/dengeli/guvenli) olarak gider,
üçüncü listenin tel adı `guvenli` (iç anahtar `garanti` kalır); vaat ve
rakam yasağı netleşti; adayın serbest metni etiket içinde veri olarak girer.
- İlk üretimde zaman aşımı: liste havuzdan kodla kurulur, üst metin bunu
söyler (ZAMAN_ASIMINDA_KODLA_KUR). KREDİ: bu yolda üretim başarılı sayılır,
iade yapılmaz. Revizyonda zaman aşımı eskisi gibi hata + iade.
- raporUretAyrintili + RaporTani: onarım/şablon/çağrı gözlemi (eval ve log).
cagri.ts
- Üst sağlayıcı gözlemi (CagriGozlemi) ve tepkisel dışlama: reasoning kapalı
istendiği hâlde düşünme token'ı üreten üst sağlayıcı 6 saat
provider.ignore ile atlanır. Ölçüm: 16 üst sağlayıcıdan yalnız AtlasCloud
isteğe uymuyor (4.000 token'ın 3.999'u düşünme, ~50 sn, içerik yarım);
zaman aşımlarının ve "iki denemede başarısız" hatasının kaynağı buydu.
robot.ts: tanılı API, yeni tel şeması, onarım/şablon/üst sağlayıcı özeti,
"Kıbrıs'ta" il çelişkisi yanlış alarmı.
Önce → sonra (40 profil, gerçek model; ayrıntı 07-liste-duzeltmeleri.md):
üretilen liste 37 → 40, zaman aşımı 3 → 0, ikinci çağrı 10 → 1.
Co-Authored-By: Claude Fable 5.1 <noreply@anthropic.com>
- 22 profilin beklenen değeri (gevşetme, minAday, hedef) B1/B2/B3/B5/B8
sonrası gerçek havuzOlustur() çıktısına eşitlendi; "liste-24-alti"
etiketi kalktı, düzelen bugların supheli kayıtları temizlendi.
- robot.ts: "alan-ilsiz-gevsedi" değişmezi artık yalnız alanda adayın
yazabileceği 24+ program varken ihlal sayar (a07: baraj yüzünden alanda
1 program kalıyor, gevşetme meşru; beklenti hatasıydı).
Önce: pnpm eval:robot 22 temiz / 18 ihlalli, çıkış 1.
Sonra: 40 temiz / 0 ihlalli, çıkış 0.
Co-Authored-By: Claude Fable 5.1 <noreply@anthropic.com>
- scripts/eval/robot.ts: 40 profilde modelsiz havuz değişmezleri (CI, çıkış kodu) ve
--model ile gerçek liste üretimi denetimi (şema, havuz-dışı, yasak ifade, il
çelişkisi, sayı tutarlılığı, Jev gerekçe grubu, gecikme, maliyet)
- scripts/eval/sohbet.ts: 112 soru gerçek danismanAkisi ile; araç kuralları, metin
kontrolü, sayı kaynağı, vaat regex'i, Jev danışman grubu
- scripts/eval/ortak.ts: kullanım ölçümü, Jev istemcisi, kod denetimleri
- package.json: eval:robot, eval:sohbet
- İlk koşu sonuçları ve rapor (04-eval-sonuclari.md)
Co-Authored-By: Claude Fable 5.1 <noreply@anthropic.com>