Kod Ajanlarında Kalite: Model Kademesi mi, Harness mi?
Kod ajanı kötü çıktı verince refleks daha güçlü model. Sınırlı görevlerde harness skoru en az kademe yükseltmek kadar oynatıyor; hangi kolu çekeceğinizi söyleyen kural.
Kod ajanı kötü bir diff ürettiğinde standart çözüm tek satırlık bir konfigürasyon: daha güçlü modele geçmek. Model ile harness’i ayrı sütunlar olarak yayımlayan benchmark tabloları bu refleksi zora sokuyor. Yetenekleri birbirine yakın modeller arasında harness’i değiştirmek skoru en az modeli değiştirmek kadar oynatıyor; modelin üstünlüğü ancak görevler uzadıkça yeniden öne çıkıyor. Bu yüzden benim varsayılanım yaygın refleksin tersi: kapalı bir doğrulama döngüsüne ve sıkı bir bağlam bütçesine sahip bir harness içinde orta kademe bir model; kademe yükseltmenin tetiği ise görevin ufku, görevin önemi değil.
Harness derken modelin etrafındaki yazılım katmanını kastediyorum: bağlam kurulumu, araç arayüzü, doğrulama döngüsü ve orkestrasyon. Karar, iki kolun da bedelini ödeyen kişiye ait: bir yanda model aboneliği, öbür yanda harness işinin istediği mühendislik zamanı.
Kademe Argümanının Haklı Olduğu Yer#
“Daha güçlü modeli al” cevabı her şeyden önce en güçlü halini hak ediyor, çünkü bir iş sınıfında düpedüz doğru.
SWE-bench Pro, harness’ler daha kolay benchmark’ı doyurduğu için var. Makalenin güncel sürümü (arXiv 2509.16941, v2, Kasım 2025), yaygın kullanılan kodlama modellerini birleşik bir scaffold altında değerlendiriyor ve hepsi %45’in altında Pass@1 skorunda kalıyor. Halka açık sette Claude Sonnet 4.5 %43,6 ile önde; GPT-OSS 120B %16,2 ile sonda. Harness sabitken aradaki fark 27 puan ve benchmark’ın yarısından fazlası her kademede çözümsüz. Zor görevler modele bağlı. Yine de makalenin ekindeki bir karşılaştırma not etmeye değer: GPT-5, 50 tur ve 2 dolarlık bütçe sınırıyla orta muhakeme eforunda %23,3 alırken, sınırsız ve yüksek eforda %41,8 alıyor. Orada iki ayar birden değişiyor; ama bütçe sınırlı koşu yüksek eforda bile %25,9’da kalıyor, yani farkın çoğunu bütçe taşıyor. Modele bağlı bir tabloda bile koşu bütçesi skoru kaydırıyor.
METR’in zaman ufku çalışması en temiz yetenek argümanı. Time Horizon 1.1 (Ocak 2026), Claude Opus 4.5’in %50 zaman ufkunu, yani modelin yarı yarıya tamamlayabildiği insan görev uzunluğunu 320 dakika olarak tahmin ediyor; %95 güven aralığı 170 ile 729 dakika arasında, yani geniş. Aynı çalışma 2023 sonrası ikiye katlanma süresini 130,8 gün, uzun vadeli eğilimi 196,5 gün olarak veriyor. Birkaç saatlik bir görevi bir arada tutabilmek modelin özelliği ve hiçbir araç yatırımının bükemediği bir eğri üzerinde iyileşiyor.
Harness’in de kendi tavanı var. Doğrulama döngüsü yanlış cevabı reddedebilir; modelin hiç önermediği doğru mimari kararı icat edemez. Dolayısıyla ufku mevcut modelinizin bir arada tutabileceğinden uzun görevlerde hiçbir doğrulama döngüsü koşuyu kurtarmaz. Kanıtların geri kalanı, delege edilen işlerin çoğunun neden bu rejimde olmadığıyla ilgili.
Scaffold’un Her Şeyi Belirlediği Dönem#
2024’ün iki sonucu birbirine zıt yönleri gösteriyor ve ikisi de birkaç hafta arayla alanın en iyisiydi. SWE-agent (NeurIPS 2024) şu tezi savundu: “LM ajanları, kendi ihtiyaçları ve yetenekleri olan yeni bir son kullanıcı kategorisidir ve kullandıkları yazılıma özel inşa edilmiş arayüzlerden fayda görürler.” Amaca özel ajan-bilgisayar arayüzü, orijinal SWE-bench’te %12,5 pass@1’e ve HumanEvalFix’te %87,7’ye ulaştı; makale bu sonuçları, etkileşimsiz LM’lerle ulaşılan önceki en iyi durumun çok ötesinde diye tarif ediyor. Modeller aynıydı; arayüz skoru katladı.
Agentless (arXiv 2407.01489) ise ters yöne gitti ve ajan döngüsünü tamamen sildi. Sabit üç fazlı bir hat (konumlandır, onar, doğrula) SWE-bench Lite’ta %32,00 çözüm oranına ulaştı (96 düzeltme) ve sorun başına maliyeti 0,70 dolardı; dönemin tüm açık kaynak ajanlarını hem skorda hem maliyette geride bıraktı. İki rakam farklı benchmark kulvarlarından geliyor ve doğrudan karşılaştırılamaz; ama ikisi de aynı derse işaret ediyor. O dönemde modelin etrafındaki yazılım sayıyı modelden daha çok oynattı ve birbirine zıt iki harness tasarımı ayrı ayrı sahanın önüne geçti.
Modelin Scaffold’u İçselleştirdiği Dönem#
Sonra ayrıntılı scaffold’ların getirisi azaldı, çünkü modellerin son eğitimi (post-training) bu işlevleri içine aldı. SWE-bench ekibinden mini-swe-agent, “sadece yaklaşık 100 satır Python” olarak tarif ettiği bir ajan sınıfıyla geliyor ve “SWE-bench Verified’da %74’ün üzerinde skor” aldığını belirtiyor (README bu rakamı belirli bir modele atfetmiyor). Aynı README dönüşümü açıkça adlandırıyor: “LM’ler yetenek kazandıkça, işe yarar bir ajan kurmak için bunların çoğuna hiç gerek kalmıyor.”
100 satır iddiasının yanında taşınması gereken bir dipnot var. 100 satır olan yalnızca kontrol döngüsü; Simon Willison, onu çevreleyen mini-swe-agent kod tabanını yaklaşık 9.000 satır Python olarak veriyor. Kontrol döngüsü sıradanlaştı; etrafındaki sistem sıradanlaşmadı.
Resmi SWE-bench leaderboard’u artık mini-swe-agent üzerinde standart bir bash-only kulvarı çalıştırıyor; amaç tam da tek değişkenin model olması. Şubat 2026 güncellemesinde Claude Opus 4.5 (yüksek muhakeme) %76,8 ile öndeydi; Gemini 3 Flash ve MiniMax M2.5 %75,8’de, Opus 4.6 %75,6’da, GPT-5.2 %72,8’deydi. Willison tasarım niyetini şöyle aktarıyor: “Bu benchmark her model için aynı sistem prompt’unu kullanıyor; bu adil bir karşılaştırma için önemli, ama farklı harness’lerin ya da optimize edilmiş prompt’ların kalitesinin burada ölçülmediği anlamına da geliyor.” Sıralamaya değil listenin şekline bakın, satırlar o güncellemenin fotoğrafı: harness sabitlendiğinde beş frontier model birbirinin dört puan yakınında.
On üç açık kaynak kodlama ajanı scaffold’unu kaynak kodu düzeyinde inceleyen taksonomi (arXiv 2604.03515) bu kaymayı yapısal olarak doğruluyor. Ajan tasarımları “dış kısıtların baskın olduğu yerlerde (araç yeteneği kategorileri, düzenleme formatları, yürütme izolasyonu)” birbirine yakınsıyor; bağlam sıkıştırma (compaction), durum yönetimi ve çoklu model yönlendirmede ise hâlâ ayrışıyor. On üç scaffold’un on biri, tek bir kontrol yapıtaşı yerine birden fazlasını birleştiriyor. Ayrışmanın sürdüğü ve mühendislik emeğine hâlâ değen kısım, bağlam yönetimi.
Harness Farkı Artık Bir Bağlam Farkı#
Terminal-Bench 2.1 şu an eldeki en keskin kanıt, çünkü ajanı ve modeli ayrı sütunlar olarak yayımlıyor; ikisinden biri sabit tutulabiliyor. Ağustos 2026 ortası itibarıyla tablodan:
| Model | Harness | Skor |
|---|---|---|
| Fable 5 | Claude Code | %83,8 |
| Fable 5 | Terminus 2 | %80,4 |
| GPT-5.5 | Codex | %83,1 |
| GPT-5.5 | Terminus 2 | %78,0 |
| Gemini 3 Pro | Terminus 2 | %73,9 |
| Gemini 3 Pro | Gemini CLI | %65,8 |
Tabloyu iki kez okuyun. Harness’i Terminus 2’de sabitleyince üç model arasındaki fark 6,5 puan (%73,9’dan %80,4’e). Modeli Gemini 3 Pro’da sabitleyince iki harness arasındaki fark 8,1 puan (%65,8’den %73,9’a). Bu tabloda, bu görev sınıfında, harness sütunu en az model sütunu kadar puan getiriyor.
Tabloda hassas biçimde ifade edilmesi gereken bir çaprazlama da var. Codex altındaki GPT-5.5 (%83,1), Terminus 2 altındaki Fable 5’i (%80,4) geçiyor; oysa ikisi ortak harness altında koştuğunda önde olan Fable 5. Bu, birbirine yakın iki model arasında bir çaprazlama ve etkinin yayımlanmış en güçlü hali. Katı bir kademe tersinmesini, yani gerçekten alt kademe bir modelin güçlü bir harness’le zayıf harness’teki bir frontier modeli birebir geçtiğini gösteren kamuya açık bir sonuç bulamadım. Verinin desteklediği iddia, frontier bandının içinde büyüklükle ilgili: sınırlı görev sınıflarında harness seçimi skora en az kademe yükseltmesi kadar etki ediyor.
Bu iddianın akademik hali de aynı şekilde sınırlandırılmış ve asıl mesele o sınır. “Stop Comparing LLM Agents Without Disclosing the Harness” (arXiv 2605.23950), Binding Constraint Thesis’i (bağlayıcı kısıt tezi) şöyle formüle ediyor: “birbirine yakın frontier yeteneğe sahip modeller arasında değerlendirilen uzun ufuklu görevlerde, ajan yürütme harness’i … çoğu zaman, sardığı modelden daha güçlü bir performans belirleyicisidir.” 3x3 faktöriyel çalışmasında (GPT-5.4, Kimi K2.6 ve GLM-5.1; her biri üç harness konfigürasyonu altında, 100 görevlik katmanlandırılmış bir SWE-bench Verified alt kümesinde) harness’e atfedilebilir varyans, modele atfedilebilir varyansın 7,80 katı çıktı (kare yüzde puanı cinsinden 18,48’e karşı 2,37) ve model sıralamaları harness’ler arasında yer değiştirdi. Oranı alıntılamadan önce kapsam koşulunu okuyun: birbirine yakın frontier yetenek. O bandın içinde skor varyansını model seçiminden çok harness açıklıyor. Makale, iyi harness’teki ucuz modelin kötü harness’teki frontier modeli yeneceği yönündeki daha güçlü iddiaya destek sunmuyor.
Pratikte harness işi ne demek#
Somut iş listesini Anthropic’in mühendislik rehberi veriyor. Bağlam mühendisliği orada “LLM çıkarımı sırasında en uygun token (bilgi) kümesini seçip koruma stratejilerinin bütünü” olarak tanımlanıyor; hedef, “istenen sonucun olasılığını en çok artıran en küçük yüksek sinyalli token kümesini” bulmak. Bu yaklaşımın karşı koyduğu mekanizma ölçülmüş durumda: Chroma’nın 18 model üzerindeki 2025 tarihli Context Rot çalışması, “modeller bağlamlarını tekdüze kullanmıyor; girdi uzunluğu arttıkça performansları giderek güvenilmezleşiyor” bulgusunu raporluyor. İlan edilen pencere, sınırına ulaşmadan çok önce bozulmaya başlıyor.
Pratikteki hamleler şunlar:
- Compaction (sıkıştırma). Dolmaya yaklaşan pencereyi özetleyip özetle yeniden başlatmak; mimari kararları, çözülmemiş hataları ve uygulama durumunu koruyarak.
- Yapılandırılmış not tutma. Durumu pencerenin dışında, bir plan dosyasında ya da NOTES.md’de tutmak ve her turda taşımak yerine gerektiğinde geri enjekte etmek.
- Alt ajanla keşif. Bir alt ajan kod tabanını okurken on binlerce token harcar ve 1.000-2.000 token’lık yoğunlaştırılmış bir özet döndürür; ana ajanın penceresi keşfi hiç görmez.
- Kademeli araç tanıtımı. Anthropic’in MCP ile kod yürütme yazısı, araç tanımlarının tümünü baştan yüklemek yerine modele dosya sisteminden ihtiyaç halinde okutarak bir iş akışının 150.000 token’dan 2.000 token’a indiğini, yani %98,7’lik bir azalmayı raporluyor.
- Ajanın çalıştırabildiği bir kontrol. Testler, build çıkış kodu, linter, ekran görüntüsü farkı. Claude Code rehberi bunun neden zorunlu olduğunu açık söylüyor: “Claude iş bitmiş göründüğünde durur. Çalıştırabileceği bir kontrol yoksa eldeki tek sinyal ‘bitmiş görünüyor’ olur ve doğrulama döngüsü siz olursunuz.” Rehberin önerdiği yol prompt talimatından başlıyor; her turda yeniden değerlendirilen bir hedef koşuluna, turu bitirmeyi engelleyen bir Stop hook’a (sekiz ardışık engellemeden sonra Claude Code hook’u aşıp turu bitiriyor) ve işi yapan ajan kendi işine not vermesin diye sonucu çürütmeyi taze bir modele deneten hakem alt ajana kadar gidiyor. İsimler Claude Code’un; desen, yani makinede doğrulanabilir bir tamamlanma kapısı, hook ya da betiklenebilir kapı sunan her harness’e taşınabilir.
İlk dört hamle token bütçesini yönetiyor; beşincisi, modelde olmayan tamamlanma sinyalini sağlıyor. Anthropic’in kendi özeti listeyi tek yerde bağlıyor: “en iyi pratiklerin çoğu tek bir kısıta dayanır: Claude’un bağlam penceresi hızla dolar ve doldukça performans düşer.”
Düzenleme formatı değişkeni#
Modelden değişikliği hangi biçimde istediğiniz, modelin kodu ne kadar iyi değiştirdiğiyle etkileşiyor; Aider’ın polyglot leaderboard’unun (altı dilde 225 Exercism problemi) düzenleme formatını skorun ve maliyetin yanında birinci sınıf bir sütun olarak izlemesinin nedeni bu. Tablodaki en son koşular Ağustos 2025 sonuna ait; bu satırları o anın fotoğrafı olarak okuyun: diff formatıyla gpt-5 (high) %88,0 ve 29,08 dolar; o3-pro (high) %84,9 ve 146,32 dolar; o3’ün (high) planlayıp gpt-4.1’in düzenlediği mimar eşleşmesi %78,2 ve 17,55 dolar. Üçüncü satır desenin minyatürü. Harness, işi rollere bölüp her rolü onu iyi yapan modele verdiği için, daha ucuz konfigürasyon o3-pro’nun yedi puan yakınına kabaca sekizde bir fiyatla geldi.
Aynı Kararın Maliyet Tarafı#
Kademenin bir liste fiyatı var; harness işi ise fiilen ödediğinizi değiştiriyor. Ağustos 2026 ortası itibarıyla milyon token başına Claude API liste fiyatları:
| Model | Girdi | Çıktı |
|---|---|---|
| Claude Fable 5 | $10 | $50 |
| Claude Opus 5 | $5 | $25 |
| Claude Sonnet 5 | $2 | $10 |
| Claude Haiku 4.5 | $1 | $5 |
Sonnet 5’ten Opus 5’e geçiş 2,5 kat; Haiku 4.5’ten Opus 5’e 5 kat. İki fiyatlandırma mekaniği harness işini bu oranlarla doğrudan yarıştırıyor: önbellek okumaları taban girdi fiyatının 0,1 katına faturalanıyor ve Batch API hem girdiyi hem çıktıyı %50 indiriyor. Opus 5’ten Sonnet 5’e inmek her yerde %60 kesinti demek. Önbelleklenmiş bir önek, kapsadığı her girdi token’ında %90 kesiyor; toplu işleme de etkileşimli yanıt gerektirmeyen her şeyde %50. Prompt önekini sabitleyen ve etkileşimsiz işleri batch’e yönlendiren bir harness, efektif maliyeti çoğu kademe kararından daha fazla oynatıyor.
Bir muhasebe tuzağı: Anthropic’in fiyatlandırma sayfası, Claude 4.7 ve sonrası modellerin “aynı metin için yaklaşık %30 daha fazla token üreten” daha yeni bir tokenizer kullandığını not ediyor. Bu yüzden model nesilleri arasında token başına fiyatlar tek başına yanıltıcı. Tokenizer değişikliğine, fiyat değişikliğine ve model değişimine dayanan birim, merge edilen PR başına maliyet; bu sayının nasıl kurulacağını yapay zeka araçları serisinin ROI bölümü ele alıyor.
Bir Sonraki Harcama İçin Karar Kuralı#
Kural varsayılana köklenmiş durumda; her dal kendi geçersiz kılma tetiğini adlandırıyor:
Burada bir tanım önemli: orta kademe, kodlama benchmark’larında hâlâ frontier’a yakın skor veren kademe demek; fiyat listesindeki en ucuz satır değil, Sonnet sınıfı. Yukarıdaki harness kanıtları birbirine yakın yetenekteki modellerle sınırlı ve varsayılan o bandın içinde kalıyor. Bant, fiyat listesinin ima ettiğinden geniş; SWE-bench Pro’nun v2 tablosunda Haiku 4.5 bile Sonnet 4.5’in yaklaşık dört puan yakınında. Ama yukarıdaki hiçbir bulgu, gerçekten alt bir banda inip farkı harness’in kapatmasını beklemeyi desteklemiyor.
Aynı sinyaller, akış şemasının net eşlemediği durumlar için tablo halinde:
| Sinyal | Harness’i işaret eder | Kademeyi işaret eder |
|---|---|---|
| Hata kipi | Fikir doğru, uygulama yanlış; önceki talimatı unutuyor | Daha ilk adımda yanlış yaklaşım seçiliyor |
| Görev ufku | Dakikalarla bir saat arası insan işi | Birkaç saatlik, çok alt sistemli iş |
| Doğrulanabilirlik | Test ya da build karara bağlıyor | Doğruluk bir yargı meselesi |
| Bağlam baskısı | Compaction görev ortasında tekrar tekrar tetikleniyor | Hata anında pencere yarıya bile gelmemiş |
| Tekrarlanabilirlik | Aynı biçimde görev, çok sayıda örnek | Tek seferlik, özgün tasarım işi |
| Marjinal harcama | Önbellek isabeti %50’nin altında, batch kullanımı yok | Önbellek ve batch zaten ayarlı |
Bir saat ve dört saat eşiklerini ölçülmüş birer eşik değil, çalışma sezgisi olarak alın; anılan deneylerin hiçbiri harness etkisini görev ufkuna göre katmanlamıyor. Eşikleri iki uçtaki kanıt sabitliyor. METR’in canlı zaman ufku sayfası (Mayıs 2026 güncellemesi) frontier %50 ufkunu kabaca on iki saat olarak tahmin ediyor (Claude Opus 4.6, 719 dakika) ve on altı saatin üzerindeki ölçümlerin mevcut görev kümesini zorladığını not ediyor; bir saatin altındaki sınırlı bir görev bu tavanın çok altında. Yukarıdaki harness varyans sonuçları ise tam da o kısa, sınırlı rejimden geliyor. Eşikler bu iki gözlem arasını dolduruyor; aşağıdaki ölçüm planı onları kendi sayılarınızla değiştirir.
Her Kolun Bedeli#
Varsayılan olan harness yatırımı, mühendislik zamanıyla ve bir bakım yüzeyiyle faturalanıyor: hook’lar, alt ajan tanımları, talimat dosyaları ve skill’ler kod tabanı değiştikçe eskiyor; ajan konfigürasyonunu da CI’ı sahiplenir gibi birinin sahiplenmesi gerekiyor. Kendine özgü bir başarısızlık kipi de var. Anthropic’in rehberi “aşırı belirlenmiş CLAUDE.md”yi adlandırılmış bir hata deseni olarak listeliyor ve “şişmiş CLAUDE.md dosyaları Claude’un asıl talimatlarınızı görmezden gelmesine yol açar” diye uyarıyor. İkinci kip daha sinsi: zayıf bir kontrole yaslanan doğrulama döngüsü, kendinden emin çöpü döngüsüz halden daha hızlı üretir.
Kademe yükseltme, liste fiyatında token başına 2,5 ile 5 kat arası bir maliyet ve etkileşimli işte gecikme demek; operasyonel yükü ise sıfıra yakın, herkesin ilk hamlesi olması tam da bundan. Başarısızlık kipi sessiz. Sınırlı görevlerde diğer koldan daha az kazandırıyor (sabit karşılaştırma tablosunda 6,5 puanlık model farkına karşı 8,1 puanlık harness farkı) ve asıl kısıtı gizlediği için ekip, darboğazın harness olduğunu keşfedene kadar bir çeyreği harcayabiliyor.
Görev başına yönlendirme, yani varsayılan artı bir eskalasyon tetiği, yukarıdaki karar kuralının sizi eninde sonunda getirdiği yer. Maliyeti, her model sürümünden sonra bakım ve yeniden ölçüm isteyen bir yönlendirme politikası. Scaffold taksonomisi çoklu model yönlendirmeyi tasarımların hâlâ ayrıştığı bileşenler arasında sayıyor; bu da kimsenin bunu henüz iyi yapamadığını söylemenin kibar bir yolu.
Muhakeme eforu (reasoning effort) kendi satırını hak ediyor, çünkü bedava bir kademe yükseltmesi gibi görünüyor. Holistic Agent Leaderboard, dokuz model ve dokuz benchmark üzerinde 21.730 koşuda, “koşuların çoğunluğunda daha yüksek muhakeme eforunun doğruluğu düşürdüğünü” raporluyor. Düğme sanılandan sık ters yöne dönüyor; yüksek eforu güvenli varsayılan saymadan önce kendi görev sınıflarınızda A/B testine sokun.
Sık Yapılan Hatalar#
- Ajan skorunu ajan sütunu olmadan alıntılamak. Yalnızca modeli adlandıran bir benchmark satırı eksik bir karşılaştırmadır. Bir sayı alıntılarken modeli, harness’i ve sürümü birlikte verin; Terminal-Bench ile bash-only SWE-bench kulvarının zorladığı gibi.
- Üreticinin scaffold sayısını kendi sayınız sanmak. Üretici skorları üreticinin ayarladığı harness’lerden gelir. Standart kulvarı taban çizgisi yapın; üretici farkını, harness ayarının size kazandırabileceğinin üst sınırı olarak okuyun.
- Pencere büyük diye pencereyi doldurmak. Bağlam çürümesi sınırdan önce başlar. İlgisiz görevler arasında durumu temizleyin ve keşfi alt ajanlara devredin ki okunanlar ana pencereye hiç girmesin.
- “Bitmiş görünüyor”u kabul etmek. Hiç çalıştırılmamış makul bir diff, ajan hatalarının klasiğidir. Ajanın çalıştırabileceği bir kontrol olmadan görev delege etmeyin; otonomi arttıkça kontrolü adım adım sertleştirin: prompt, sonra hedef koşulu, sonra engelleyici hook.
- Aynı hatayı bir oturumda üçüncü kez düzeltmek. İki başarısız düzeltmeden sonra bağlam ölü yaklaşımlarla kirlenmiştir ve sonraki her tur onların üzerine koşullanır. Sıfırlayın ve açılış prompt’unu öğrendiklerinizle yeniden yazın.
- Her MCP araç tanımını baştan yüklemek. Araç şemaları bağlamdır. Kademeli tanıtımı tercih edin ve işlevini bir CLI’ın zaten karşıladığı sunucuları bırakın; Anthropic’in rehberi CLI araçlarını “harici servislerle etkileşimin bağlam açısından en verimli yolu” diye niteliyor.
- Ajanı en kolay görev sınıfınızda benchmark’lamak. Doymuş benchmark’lar her konfigürasyonu olduğundan iyi gösterir; SWE-bench Pro, kolay tabloların ayrıştırmayı bırakması yüzünden var. Delege ettiğiniz işe benzeyen zor bir küme ayırın.
- Hakem gözden geçiricinin her bulgusunu işleme almak. Açık bulması istenen bir gözden geçirici açık bulur. Anthropic, hepsinin peşinden gitmenin “aşırı mühendisliğe yol açtığı: fazladan soyutlama katmanları, savunmacı kod ve gerçekleşmesi imkansız durumlar için testler” konusunda uyarıyor.
Bütçeyi Oynatmadan Önce Ölçülecekler#
Yukarıdaki kural kamuya açık benchmark’lardan kuruldu; sizin backlog’unuzda geçerli olup olmadığı deneysel bir soru. Aşağıdakiler, kurala dayanıp bütçe oynatmadan önce gerçek iş yüklerinde toplamayı planladığım sayılar; aynı küme bir ekip için kalıcı bir gösterge paneli olarak da çalışır:
- İlk geçişte doğrulama oranı: ajanın kendi kontrolünün hiç insan turu olmadan geçtiği görevlerin payı. En iyi harness metriği.
- Tamamlanan görev başına insan müdahalesi, görev sınıfına göre izlenerek: düzeltmeler, yönlendirmeler, geri sarmalar.
- Merge edilen PR başına maliyet: tokenizer ya da fiyat değişikliğine dayanan tek maliyet birimi.
- Görev sonunda bağlam doluluğu ve görev başına compaction sayısı: öncü gösterge. Yükselen compaction sayısı, kalite düşüşünü çıktıda görünmeden önce haber verir.
- Eskalasyon oranı: bitmesi için kademe yükseltme gereken görevler. Frontier varsayılanda sıfıra yakınsa fazla ödüyorsunuz; kısa görevlerde yüksekse kısıt harness’tedir.
- Yeniden iş oranı: 14 gün içinde geri alınan ya da yeniden açılan ajan yapımı PR’lar.
- Önbellek isabet oranı ve etkileşimsiz token’larda batch payı: kademeye hiç dokunmayan iki harcama kolu.
- Görev sınıfı başına yeşil CI’a medyan süre (wall-clock).
Bu sayıların iki sprint’lik toplamı, akış şemasının sorularını veriyle yanıtlar.
Kuralın Geçerlilik Sınırı#
Varsayılan, yani kapalı doğrulama döngüsü ve bilinçli bir bağlam bütçesiyle çalışan orta kademe model, sprint’lerin çoğunu dolduran sınırlı ve makinede doğrulanabilir işi kapsıyor: kırmızı testi yeşile çevirmek, tipli refactor’lar, çok sayıda benzer dosyaya yayılan migration’lar. Kural, METR eğrisinin işaret ettiği yerde bitiyor: birkaç saati aşan ufuklar, özgün tasarım işleri ve daha ilk adımda yanlış yaklaşımı seçen hatalar. Orada tavanı model koyuyor ve karşılığını veren harcama kademe oluyor. Kendi sayılarınız oluşana kadar bunu kalibre edilmiş bir başlangıç noktası sayın; yukarıdaki ölçüm planı sıradaki adım ve henüz benim de önümde duruyor.
Kaynaklar#
- SWE-agent: Agent-Computer Interfaces Enable Automated Software Engineering (arXiv) (yeni sekmede açılır) - Ajan-bilgisayar arayüzünü birinci sınıf bir değişken yapan 2024 makalesi; yukarıda anılan SWE-bench ve HumanEvalFix sonuçlarının kaynağı.
- Agentless: Demystifying LLM-based Software Engineering Agents (arXiv) (yeni sekmede açılır) - Ajan döngüsü olmadan, konumlandır-onar-doğrula hattıyla dönemin açık kaynak ajanlarını skorda ve maliyette geçen çalışma.
- mini-swe-agent (GitHub) (yeni sekmede açılır) - Standart SWE-bench bash-only kulvarının üzerinde koştuğu yaklaşık 100 satırlık kontrol döngüsü; yukarıda alıntılanan README ifadelerinin kaynağı.
- SWE-bench Verified leaderboard (yeni sekmede açılır) - Resmi tablo; modellerin temiz karşılaştırılabilmesi için harness’i sabitleyen bash-only kulvarı dahil.
- The SWE-bench February 2026 update (Simon Willison) (yeni sekmede açılır) - Şubat 2026 bash-only rakamlarının, 9.000 satırlık harness tarifinin ve ortak sistem prompt’unun neyi dışarıda bıraktığı notunun kaynağı.
- Terminal-Bench 2.1 leaderboard (yeni sekmede açılır) - Ajanı ve modeli ayrı sütunlar olarak yayımlayan tablo; yukarıdaki altı satırlık tablonun kaynağı.
- Stop Comparing LLM Agents Without Disclosing the Harness (arXiv) (yeni sekmede açılır) - Binding Constraint Thesis’in, 3x3 faktöriyel çalışmanın ve harness bildirim protokolünün arkasındaki pozisyon makalesi.
- Holistic Agent Leaderboard (arXiv) (yeni sekmede açılır) - Daha yüksek muhakeme eforunun koşuların çoğunda doğruluğu düşürdüğü bulgusunun geldiği 21.730 koşuluk değerlendirme.
- SWE-Bench Pro: Can AI Agents Solve Long-Horizon Software Engineering Tasks? (arXiv) (yeni sekmede açılır) - Kontaminasyona dirençli uzun ufuklu benchmark; v2 sonuçlarında birleşik scaffold altında değerlendirilen her model %45 Pass@1’in altında kalıyor.
- Inside the Scaffold: A Source-Code Taxonomy of Coding Agent Architectures (arXiv) (yeni sekmede açılır) - Ajan tasarımlarının nerede yakınsadığını, bağlam yönetiminin nerede hâlâ ayrıştığını gösteren on üç scaffold’luk analiz.
- Effective context engineering for AI agents (Anthropic) (yeni sekmede açılır) - Yukarıda anılan bağlam mühendisliği, compaction, yapılandırılmış not ve alt ajan mimarisi tanımlarının kaynağı.
- Best practices for Claude Code (Anthropic) (yeni sekmede açılır) - Doğrulama kontrolünü sertleştirme yolu, bağlam yönetimi rehberi ve yukarıda alıntılanan adlandırılmış hata desenleri.
- Code execution with MCP (Anthropic) (yeni sekmede açılır) - Kademeli araç tanıtımı; 150.000 token’dan 2.000 token’a inen işlenmiş örnek dahil.
- Context Rot: How Increasing Input Tokens Impacts LLM Performance (Chroma) (yeni sekmede açılır) - Güvenilirliğin ilan edilen pencere sınırından çok önce, girdi büyüdükçe düştüğünü gösteren 18 modellik çalışma.
- Time Horizon 1.1 (METR) (yeni sekmede açılır) - Model kademesinin tavanı belirlediği rejimi tanımlayan zaman ufku tahminleri ve ikiye katlanma süreleri.
- Task-Completion Time Horizons (METR) (yeni sekmede açılır) - Karar kuralı bölümünde anılan on iki saatlik frontier tahmininin arkasındaki, sürekli güncellenen ufuk sayfası.
- Aider LLM leaderboards (yeni sekmede açılır) - Düzenleme formatını skor ve maliyetle birlikte izleyen polyglot tablo; Ağustos 2025 fotoğrafının kaynağı.
- Claude API pricing (yeni sekmede açılır) - Liste fiyatları, önbellek ve batch çarpanları ve nesiller arası token başına karşılaştırmayı bozan tokenizer notu.
İlgili yazılar
Ajanlar kod yazmayı neredeyse bedavaya indirdi; ama onları ne zaman ve ne kadar kullanacağınız konusundaki yargı hâlâ tamamen size ait. İki beceriyi ayıran bir çerçeve.
ai-tools · claude-code · ai-agents +3
Claude Code, Codex, Copilot, Cursor ve OpenCode'un aynı kuralları okumasını sağlayan pratik bir repo düzeni ve taşınabilirliğin kırıldığı noktaların dürüst bir özeti.
ai-tools · claude-code · github-copilot +3
Kurumsal LLM uygulamaları için production-grade prompt engineering rehberi: sistematik tasarım, güvenlik, observability ve maliyet optimizasyonu.
prompt-engineering · llm · ai-tools +6
LangChain'i production'da çalıştırırken öğrenilen dersler: hataya yol açan anti-patternler, işe yarayan patternler, kod örnekleri ve maliyet optimizasyonu.
langchain · llm · production +5
GitHub Spec Kit, başıboş AI kod üretimini dört aşamalı specify-plan-tasks-implement döngüsüyle yapılandırılmış ve sürdürülebilir koda nasıl dönüştürür.
ci-cd · ai-tools · code-quality +4