İçeriğe atla

RAG mi, Fine-Tuning mi, Hazır AI mi? Kurumsal Karar Rehberi

Kurumsal AI entegrasyonu için pratik 6 seviyeli framework: ChatGPT, RAG, MCP agent veya fine-tuning ne zaman kullanılmalı, PII ve finans uyumluluğu odaklı.

Ayhan Sipahi Ayhan Sipahi

Kurumsal AI benimseme süreci tahmin edilebilir bir patern izler: ekipler basit alternatifleri doğrulamadan sofistike mimarilere yönelir. L1’deki doğrudan sohbetten L6’daki fine-tuning’e uzanan altı seviyeli bir merdiven, bu seçenekleri arkalarındaki iş ihtiyacıyla karşılaştırmayı kolaylaştırır. Varsayılan, çoğu yol haritasının sandığından daha aşağıdadır. L2, yani yüklü bilgi dosyalarıyla bir sistem prompt’u, hak ettiğinden fazla dahili senaryoyu çözer; yukarı ancak ölçülmüş bir kısıtlama seni zorladığında çıkarsın.

Bu varsayılanı iki kısıt geçersiz kılar. PII pazarlıksız bir mimari sınırdır: kişisel veri akışa girdiği anda, ne kadar uygun görünürse görünsün L1 ve L2 masadan kalkar. Bu sınırın devreye girmediği yerlerde merdivende yukarı çıkmak, olay bazında tartabileceğin bir maliyet ve karmaşıklık kararına dönüşür. İkinci kısıt finansal hizmetlerde devreye giriyor: GDPR ve KVKK’nın üzerine denetim izi, açıklanabilirlik ve insan gözetimi düzenleyici zorunluluk olarak ekleniyor.

Tarayıcı Sekmesinden Eğitilmiş Modele Altı Seviye#

Merdivende her basamak yukarısı yetenek kazandırır; bedelini karmaşıklık, geliştirme süresi ve operasyon yüküyle ödersin.

L1: SaaS AI Chat ChatGPT/Claude Doğrudan

L2: Custom GPT / Claude Projects System Prompt + Bilgi Dosyaları

L3: Otomasyon Araçları n8n, Make, Zapier + AI

L4: RAG Altyapısı Vector DB + Embeddings + LLM

L5: MCP ile Custom Agent Araç Orkestrasyonu + Bellek

L6: Fine-tuning / Kendi Modeller Özel Eğitim + Self-hosted

Tarayıcı Sekmesi ve Yüklenen Dosya (L1 ve L2)#

L1 bir tarayıcı sekmesi: ChatGPT, Claude ya da benzeri bir servis, doğrudan kullanılıyor. Entegrasyon yok, özelleştirme yok, bağlam elle yapıştırılıyor. Kullanıcı başına aylık $20-60 ve sıfır geliştirme süresiyle bireysel üretkenlik işlerinin doğal adresi: yazma, beyin fırtınası, kod inceleme, kamuya açık bilgi üzerinde araştırma, prompt prototipleme, ad-hoc teknik sorular.

Sınırlar bu basitliğin öbür yüzü. Oturumlar arasında hiçbir şey kalıcı değil, denetim izi yok, iş sistemlerine bağlanan bir şey yok ve yapıştırdığın her şey, PII dahil, üçüncü taraf bir sağlayıcının altyapısına gidiyor.

// L1 yeterli olduğunda
// Senaryo: Geliştirici algoritma optimizasyonu yardımı istiyor

// Kullanıcı Claude'a doğrudan yapıştırıyor:
const prompt = `
Büyük dizilerde yavaş çalışan sıralama fonksiyonum var.
Optimizasyon önerebilir misin?

function bubbleSort(arr) {
  for (let i = 0; i < arr.length; i++) {
    for (let j = 0; j < arr.length - i - 1; j++) {
      if (arr[j] > arr[j + 1]) {
        [arr[j], arr[j + 1]] = [arr[j + 1], arr[j]];
      }
    }
  }
  return arr;
}
`;

// API gerekmiyor, altyapı gerekmiyor, geliştirme süresi gerekmiyor
// Bu kullanım senaryosu için doğru seviye bu

L2 aynı tarayıcı sekmesinde kalır, üzerine iki şey ekler: özel bir sistem prompt’u ve yüklenen bilgi dosyaları. Bu ikisi genel asistanı uzmanlaşmış bir asistana çevirir; kullanıcı başına aylık $25-60’lık Team veya Enterprise katmanında 2-8 saatlik bir kurulumla. Sabit içerikli dahili bilgi tabanları, kamuya açık politika Soru-Cevap’ı, işe alım asistanları, teknik dokümantasyon arama ve ürün SSS sistemleri buraya sığar.

# Örnek Claude Project Yapılandırması
Name: "Uyumluluk Politikası Asistanı"
System Prompt: |
  Organizasyonumuz için bir uyumluluk asistanısın.
  Bilgin yüklü politika belgeleriyle sınırlı.

  Kurallar:
  - Sadece yüklü belgelere dayalı soruları yanıtla
  - Bilgi belgelerde yoksa, açıkça söyle
  - Her zaman kaynak belgeyi ve bölümü belirt
  - Asla politika veya prosedür uydurma
  - Kapsam dışındaki sorular için compliance@company.com'a yönlendir

Knowledge Files:
  - calisan-el-kitabi-2025.pdf (150 sayfa)
  - kara-para-aklama-politikasi.pdf (80 sayfa)
  - veri-koruma-yonergeleri.pdf (45 sayfa)

Context Window Kullanımı:
  - System prompt: ~500 token
  - Bilgi getirme: ~50,000 token (dinamik yüklenen)
  - Konuşma geçmişi: ~20,000 token
  - Yanıt için mevcut: ~129,500 token (Claude 200K)

L2 Yeterlilik Kontrol Listesi:

  • İçerik çoğunlukla statik (güncellemeler haftada birden az)
  • PII veya hassas iş verisi gerekmiyor
  • Bilgi tabanı token limitlerinin içinde
  • Gerçek zamanlı sistem entegrasyonu gerekmiyor
  • Takım boyutu 50 kullanıcının altında
  • Düzenleyici denetim izi gereksinimleri yok

n8n, Make ve Zapier İçinde AI Çağrıları (L3)#

L3’te iş akışı platformları AI çağrılarını otomasyonların içine yerleştirir; modeller özel geliştirme olmadan iş sistemlerine bağlanır. Aylık $50-600 platform maliyeti artı API giderleri ve bir-iki haftalık kurulum bekle.

Platform karşılaştırması:

Özellikn8nMakeZapier
Self-hostingEvetHayırHayır
SOC 2Evet (Cloud)EvetEvet
GDPR UyumlulukEvet (self-host)EvetEvet
Min Takım Maliyeti$25/ay$16/ay$20/ay
En UygunKontrol, karmaşık akışlarDengeBasitlik

Bu seviye kendini yüksek hacimli tekrar eden görevlerde, çoklu sistem orkestrasyonunda ve olay tabanlı yanıtlarda amorti eder; özellikle ayrı bir AI mühendisliği kapasitesi olmayan ekipler için.

// n8n iş akışı örneği: Destek bileti sınıflandırma
const ticketClassificationWorkflow = {
  // Node 1: Webhook yeni Zendesk bileti alıyor
  trigger: {
    type: "webhook",
    source: "zendesk"
  },

  // Node 2: AI sınıflandırma
  aiClassification: {
    prompt: `
      Bu destek biletini bir kategoriye sınıflandır:
      - billing: Ödeme, fatura, abonelik sorunları
      - technical: Ürün hataları, API hataları, entegrasyon problemleri
      - account: Giriş, izinler, profil güncellemeleri
      - sales: Fiyatlandırma soruları, yükseltmeler, kurumsal talepler

      Bilet Konusu: {{ticket.subject}}
      Bilet Açıklaması: {{ticket.description}}

      JSON döndür: {"category": "...", "urgency": "low|medium|high"}
    `
  },

  // Node 3: Sınıflandırmaya göre yönlendir
  routing: {
    billing: { queue: "fatura-takimi", sla: "24s" },
    technical: { queue: "muhendislik-destek", sla: "4s" },
    account: { queue: "musteri-basarisi", sla: "12s" },
    sales: { queue: "satis-takimi", sla: "2s" }
  }
};

// Ayda 5,000 bilet için maliyet:
// n8n Cloud: $25 + OpenAI API ~$10 = $35/ay
// vs. manuel yönlendirme: Günlük 2+ saat insan zamanı

L4’te Getirme Hattını Kendin Kurmak#

L4, gerçek mühendislik gerektiren ilk basamak: kendi kurduğun retrieval-augmented generation; vektör veritabanı, embedding modeli ve orkestrasyon koduyla. Pipeline üzerindeki tam kontrolün bedeli aylık $500-2000 altyapı ve 4-8 haftalık geliştirme.

Mimari genel bakış:

Kullanıcı Sorgusu

Embedding Modeli

Vektör Arama

Belge Deposu

Chunking Pipeline

Getirilen Parçalar

LLM Üretim

Yanıt + Alıntılar

AWS Bedrock Knowledge Bases uygulaması:

import {
  BedrockAgentRuntimeClient,
  RetrieveAndGenerateCommand
} from "@aws-sdk/client-bedrock-agent-runtime";

interface RAGResponse {
  answer: string;
  citations: Array<{
    source: string;
    content: string;
    score: number;
  }>;
}

async function queryKnowledgeBase(
  question: string,
  knowledgeBaseId: string
): Promise<RAGResponse> {
  const client = new BedrockAgentRuntimeClient({ region: "eu-west-1" });

  const command = new RetrieveAndGenerateCommand({
    input: { text: question },
    retrieveAndGenerateConfiguration: {
      type: "KNOWLEDGE_BASE",
      knowledgeBaseConfiguration: {
        knowledgeBaseId,
        modelArn: "arn:aws:bedrock:eu-west-1::foundation-model/anthropic.claude-sonnet-4-5-20250929-v1:0",
        retrievalConfiguration: {
          vectorSearchConfiguration: {
            numberOfResults: 10,
            overrideSearchType: "HYBRID"
          }
        },
        generationConfiguration: {
          promptTemplate: {
            textPromptTemplate: `
Sağlanan bağlama dayalı soruları yanıtlayan yardımcı bir asistansın.

Bağlam:
$search_results$

Soru: $query$

Talimatlar:
- Sadece sağlanan bağlama dayalı yanıtla
- Bağlam yanıtı içermiyorsa, söyle
- Her zaman kaynak belgeyi belirt
- Kısa ama kapsamlı ol
`
          }
        }
      }
    }
  });

  const response = await client.send(command);

  return {
    answer: response.output?.text || "Yanıt üretilemedi",
    citations: response.citations?.map(c => ({
      source: c.retrievedReferences?.[0]?.location?.s3Location?.uri || "Bilinmiyor",
      content: c.retrievedReferences?.[0]?.content?.text || "",
      score: c.retrievedReferences?.[0]?.score || 0
    })) || []
  };
}

Bu iş, bilgi tabanı L2’yi taşırdığında zorunlu hale gelir: 200K tokenı veya 20 dosyayı aşan içerik, günlük değişen belgeler, kendin kontrol etmen gereken chunking ya da getirme mantığı. Kalan tetikleyiciler uyumluluk kaynaklı ve biri bile yetiyor: sorgu ve yanıtların zorunlu denetim izi, kanıtlaman gereken veri yerleşimi ya da günde binin üzerinde sorgu.

Aylık maliyet dökümü (100K sorgu/ay):

BileşenServisMaliyet
Vector DBOpenSearch Serverless (2 OCU)$350
EmbeddingsTitan (100K sorgu x 500 token)$1
LLMClaude Sonnet (100K x 2K token)$600
DepolamaS3 (100GB belge)$3
LambdaSorgu işleme$20
Toplam~$980/ay

MCP Üzerinden Araç Kullanan L5 Agent’ları#

L5 modele el kazandırır: Model Context Protocol (MCP) üzerinden araç erişimli agent’lar akıl yürütür, planlar ve sistemler arasında eylem alır.

Mimari paterni:

Claude Agent Planlama + Akıl Yürütme

MCP Server 1 Veritabanı Araçları

MCP Server 2 Harici API'ler

MCP Server 3 Dosya Sistemi

Bellek Sistemi Vector + KV Store

MCP Server uygulama örneği:

// Not: Bu örnek MCP SDK v1.x pattern'lerini kullanır
import { McpServer } from "@modelcontextprotocol/sdk/server/mcp.js";
import { StdioServerTransport } from "@modelcontextprotocol/sdk/server/stdio.js";
import { z } from "zod";

const server = new McpServer({
  name: "musteri-destek-araclari",
  version: "1.0.0"
});

// Araç: Email ile müşteri arama (sadece PII olmayan bilgi döndürür)
server.tool(
  "lookup_customer",
  {
    email: z.string().email().describe("Müşteri email adresi")
  },
  async ({ email }) => {
    const customer = await db.customers.findByEmail(email);

    if (!customer) {
      return {
        content: [{
          type: "text",
          text: JSON.stringify({ found: false })
        }]
      };
    }

    // Sadece hassas olmayan müşteri bilgisi döndür
    return {
      content: [{
        type: "text",
        text: JSON.stringify({
          found: true,
          customer_id: customer.id,
          tier: customer.subscription_tier,
          account_status: customer.status
          // Not: Tam isim, adres, ödeme bilgisi gibi PII yok
        })
      }]
    };
  }
);

// Araç: Bilet oluştur (yüksek öncelik insan onayı gerektirir)
server.tool(
  "create_ticket",
  {
    customer_id: z.string(),
    subject: z.string(),
    description: z.string(),
    category: z.enum(["billing", "technical", "account", "other"]),
    priority: z.enum(["low", "medium", "high"])
  },
  async ({ customer_id, subject, description, category, priority }) => {
    // Yüksek öncelik veya faturalama = insan onayı gerekli
    if (priority === "high" || category === "billing") {
      return {
        content: [{
          type: "text",
          text: JSON.stringify({
            status: "pending_approval",
            message: "Bu bilet insan onayı gerektiriyor"
          })
        }]
      };
    }

    const ticket = await db.tickets.create({
      customer_id, subject, description, category, priority,
      created_by: "ai-agent"
    });

    // Uyumluluk için denetim log kaydı
    await auditLog.write({
      action: "ticket_created_by_agent",
      ticket_id: ticket.id,
      timestamp: new Date()
    });

    return {
      content: [{
        type: "text",
        text: JSON.stringify({ status: "created", ticket_id: ticket.id })
      }]
    };
  }
);

async function main() {
  const transport = new StdioServerTransport();
  await server.connect(transport);
}

main();

L5’in sinyali, tek bir getirme geçişinin karşılayamadığı iş akışıdır: çok adımlı planlar, bağlama göre değişen araç seçimi, tek sorguda birden fazla sisteme dokunmak, koşullu karar ağaçları ya da akışın ortasında bir insan onayı adımı.

Fine-tuning ve L6’nın Neden Beklediği#

L6, kendi verin üzerinde eğitim demek; yalnızca prompting ile elde edilemeyen davranış için. Aylık $2000-10000 civarında başlar ve bünyede ML uzmanlığı varsayar; buraya getirilen senaryoların çoğu da zaten bir basamak aşağıya aittir.

Fine-tuning ne zaman gerçekten mantıklı:

SenaryoNeden Fine-tuningÖnce Dene
Uzman terminolojiModel jargonu anlamıyorFew-shot prompting
Tutarlı çıktı formatıSıkı formatlama gereksinimleriÇıktı ayrıştırma
Düşük gecikmeTek çıkarım vs RAGModel damıtma
Ölçekte maliyetYüksek hacim, token başı pahalıDaha küçük model
Tescilli bilgiHarici API kullanılamazOn-premises RAG

Fine-tuning’den ne zaman kaçınmalı:

  • Problem daha iyi prompting ile çözülebilir (önce few-shot dene)
  • Veri sık değişiyor (yeniden eğitim pahalı)
  • Küçük veri seti (1000’den az örnek) - overfitting riski
  • Bütçe kısıtlamaları (AI için aylık $1000’in altında)
  • Takım eğitim verisi kürasyon için ML uzmanlığı yok

PII: Pazarlıksız Mimari Sınır#

PII (Kişisel Tanımlanabilir Bilgi) mimarinin yapmak zorunda olduğu işi değiştirir. Aşağıdaki gereksinimlerin tamamı kanundan geldiği için, sistem ne kadar iyi çalışırsa çalışsın birini atlamak elinde bir uyumluluk ihlali bırakır.

Hayır

Evet

Doğrudan Tanımlayıcılar İsim, TC, Email

Hassas PII Sağlık, Finans

Özel Kategoriler Biyometrik, Genetik

Veri Sınıflandırma

PII İçeriyor mu?

L1-L6 Tüm Seçenekler

PII Tipi?

L4+ Minimum Şifreleme Gerekli

L4+ ile Ek Kontroller

L6 Gerekli Veri Yerleşimi

Seviyeye göre PII işlem gereksinimleri:

PII ile L3 (minimum uygulanabilir):

interface L3PIIConfig {
  platform: "n8n-self-hosted" | "enterprise-tier-with-dpa";

  aiProvider: {
    // Veri İşleme Anlaşması gerekli
    dataProcessingAgreement: string;
    dataResidency: "eu" | "tr" | "specific-region";
  };

  security: {
    encryptionAtRest: true;
    encryptionInTransit: true;
    auditLogging: true;
  };

  compliance: {
    retentionPolicy: "30-gun" | "gerektigi-kadar";
    deletionProcedure: "belgelenmis-ve-test-edilmis";
  };
}

PII ile L4 (önerilen):

interface L4PIIArchitecture {
  vectorDatabase: {
    // Self-hosted veya uygun DPA ile
    provider: "opensearch-self-hosted" | "pgvector" | "qdrant-private";
    encryption: {
      atRest: "AES-256";
      inTransit: "TLS-1.3";
      keyManagement: "AWS-KMS" | "HashiCorp-Vault";
    };
  };

  llmProvider: {
    // VPC endpoint ile AWS Bedrock - veri public internet'e çıkmıyor
    type: "aws-bedrock";
    vpcEndpoint: true;
    modelInvocationLogging: true;
  };

  dataHandling: {
    // PII embedding öncesi tokenize edilmeli
    preprocessing: "tokenization";
    tenantIsolation: true;
    rowLevelSecurity: true;
  };
}

PII henüz akışta olmasa da olası görünüyorsa, mimariyi baştan ona göre kur: L4 düzeyinde altyapı, temel bir özellik olarak denetim loglama ve en başta verilmiş bir veri yerleşimi kararı. Sınıflandırma hiç değişmezse bu kontrollerin herhangi birini ilerleyen aşamada gevşetebilirsin.

Finansın GDPR Üstüne Eklediği#

Finansal hizmetlerin, genel GDPR uyumluluğunun kapsamadığı AI gereksinimleri vardır.

Düzenleyici çerçeve:

Yetki AlanıTemel DüzenlemelerAI-Spesifik Gereksinimler
ABGDPR, AI Act, MiFID IIAçıklanabilirlik, insan gözetimi
ABDGLBA, FCRA, eyalet yasalarıAdil kredi, olumsuz işlem bildirimleri
Birleşik KrallıkUK GDPR, FCA kurallarıTüketici Görevi, operasyonel dayanıklılık
TürkiyeKVKK, BDDK düzenlemeleriVeri yerelleştirilmesi (sektöre özgü, bankacılıkta daha sıkı), özel kategoriler

L1-L2’de finans ekipleri yine de kamuya açık veri üzerinde dahili araştırma yapabilir, müşteri içermeyen kodu inceleyebilir, genel iş metinleri yazabilir ve eğitim materyali hazırlayabilir. Müşteri veri analizi, işlem izleme, kredi kararları ve yatırım tavsiyesi ise bu seviyelerde genellikle yasaktır.

Finansa özgü L4+ gereksinimleri:

interface FinanceAIRequirements {
  auditTrail: {
    inputLogging: true;
    modelVersionLogging: true;
    outputLogging: true;
    retentionPeriod: "7-yil"; // Düzenleyici minimum
  };

  explainability: {
    humanReadableExplanations: true;
    featureImportance: true;
    adverseActionNotices: true; // Kredi kararları için
  };

  humanOversight: {
    materialThreshold: 10000; // > $10K işlemler
    appealProcess: true;
    escalationPath: true;
  };

  modelRiskManagement: {
    // SR 11-7 / OCC 2011-12'ye göre
    modelValidation: "bagimsiz-takim";
    ongoingMonitoring: true;
    performanceTesting: "ucaylik";
  };
}

GDPR/KVKK Uygulama Öncesi Kontrol Listesi:

  • Yasal dayanak belirlendi (onay, sözleşme, meşru menfaat)
  • Yüksek riskli işleme için Veri Koruma Etki Değerlendirmesi yapıldı
  • Teknik önlemler uygulandı (şifreleme, erişim kontrolleri, denetim loglama)
  • AI sağlayıcı ile Veri İşleme Anlaşması imzalandı
  • Veri sahibi hakları prosedürleri belgelendi (erişim, silme, taşınabilirlik)
  • İşleme faaliyeti VERBIS’te kaydedildi
  • Gizlilik bildirimi AI işlemesini içerecek şekilde güncellendi

Bunların hiçbiri yayına çıktıktan sonra üstüne eklenemez. Model riski dokümantasyonu, baştan kurgulanmış açıklanabilirlik, önemli kararlarda döngüdeki insan, yedi yıllık denetim izi ve bağımsız doğrulama ilk tasarım turunu şekillendirmek zorunda.

Gereksinimden Seviyeye#

PII sınırı, finans gereksinimleri ve seviye limitleri tek bir akış şemasında toplanıyor:

Evet

Hayır

Evet

Hayır

Hayır

Evet

Hayır

Evet

Hayır

Evet

Hayır

Evet

Hayır

Evet

Ne inşa ediyorsun?

PII veya hassas veri içeriyor mu?

L3+ minimum uygun kontrollerle

Sistem entegrasyonu gerekli mi?

L3+

Bilgi tabanı gerekli mi?

L1 yeterli

200K token veya 20 belgeyi aşıyor mu?

L2 yeterli

Gerçek zamanlı güncelleme veya özel mantık?

L2 çalışabilir manuel yenilemeyle

Çok adımlı akıl yürütme veya araç kullanımı?

L4 RAG

Yüksek hacimli tekrar eden görev?

L5 Custom Agent'lar

L5 doğruladıktan sonra L6 düşün

Seviye seçim matrisi:

Kullanım SenaryosuÖnerilen SeviyeYükseltme Sinyali
Kişisel üretkenlikL1Takım paylaşımlı erişim istiyor
Dahili SSS (küçük)L2İçerik limitleri aşıyor
Dahili SSS (büyük)L4Çoklu sistem verisi gerekli
Destek bileti yönlendirmeL3Karmaşık yönlendirme mantığı
Eylem alan destek agent’ıL5Yok - doğru uyum bu
Uyumluluk belge kontrolüL2-L3Denetim izi gerekli
Belge analiziL4Alana özgü doğruluk
İşlem sınıflandırmaL6Ölçekte gecikme/maliyet kritik

Önce L2 sürümünü yayına al, doğruluğu ve kullanıcı memnuniyetini ölç ve çarptığın somut sınırları not et. L4’ü yalnızca L2’nin ölçülebilir biçimde yetersiz kaldığı durumlar için kur; L2 asistanı da hâlihazırda iyi yanıtladığı basit sorgulara bakmayı sürdürsün.

İki Proje, İki Zıt Hata#

Bir şirket 500 sayfalık çalışan el kitabı için AI asistanı istedi; mühendislik teklifi tam bir L4 kurulumuydu: OpenSearch, özel embedding pipeline’ı, 8 haftalık takvim. Gereksinim analizi başka bir şey söylüyordu:

  • 500 sayfa = ~250K token (Claude’un bağlam penceresinin içinde)
  • Güncellemeler: üç ayda bir el kitabı revizyonu
  • Kullanıcılar: 200 çalışan
  • Denetim izi gereksinimi yok

L2 Claude Project işi karşıladı: 2 saatlik kurulum, aylık $5,000 ($25’lik Team planında 200 kullanıcı), el kitabı Soru-Cevap’ı için yeterli doğruluk. Tasarruf, 8 haftalık geliştirme artı süresiz çalışacak altyapıydı.

Zıt yöndeki hata daha ağır sonuç taşıyor. Bir fintech startup’ı, hızlı kurulduğu ve altyapı istemediği için müşteri işlem paterni analizini L1 ChatGPT üzerinden yürüttü. İşlem verisi PII’dir: OpenAI ile veri işleme anlaşması yoktu, düzenleyici incelemeye gösterilecek denetim izi yoktu ve veri her sorguda yetki alanının dışına çıkıyor olabilirdi. Bu eksiklerin her biri tek başına GDPR ve KVKK riski taşıyor. Bu iş yükünün tabanı AWS Bedrock üzerinde L4: veri AWS içinde kalsın diye VPC endpoint, denetim izi için model çağrı loglaması, veri yerleşimi için AB/TR bölgesi.

Ayda 10K Sorguda Maliyet#

Orta ölçekli bir kurum için tahminler:

SeviyeAltyapıAPI/KullanımGeliştirme Süresi (Tek Seferlik)Aylık Toplam
L1$0$400 (20 kul.)0$400
L2$0$500 (20 kul.)8 saat$500
L3$100$5040 saat$150
L4$500$300160 saat$800
L5$1,000$800320 saat$1,800
L6$2,500$500400 saat$3,000

Geliştirme maliyetleri tek seferlik; devam eden bakım L4’ten yukarısında aylık toplama eklenir.

Seviye İçinde Model Seçimi#

Seviye seçimi mimariyi sabitler ama birim ekonomiyi içeride hangi modelin çalıştığı belirler. Premium modeller çoğu zaman daha ucuzunun aynı kalitede yaptığı işlere yönlendiriliyor.

Ocak 2026 Model Fiyatları#

Anthropic Claude Modelleri:

ModelInput (/1M)Output (/1M)ContextEn Uygun
Opus 4.5$5.00$25.00200KKompleks akıl yürütme, kritik kararlar
Sonnet 4.5$3.00$15.00200K-1MKod analizi, RAG, genel amaç
Haiku 4.5$1.00$5.00200KHızlı işler, sınıflandırma, basit Q&A
Haiku 3.5$0.80$4.00200KBütçe işleri, yüksek hacim

OpenAI Modelleri:

ModelInput (/1M)Output (/1M)ContextEn Uygun
GPT-4.1$2.00$8.001MGenel amaç, geniş context
o3$2.00$8.00200KKompleks akıl yürütme, matematik, kodlama
o4-mini$1.10$4.40200KHızlı akıl yürütme görevleri
GPT-4o$2.50$10.00128KMultimodal, genel amaç
GPT-4o-mini$0.15$0.60128KBütçe işleri, basit operasyonlar

Google Gemini Modelleri:

ModelInput (/1M)Output (/1M)ContextEn Uygun
Gemini 2.5 Pro$1.25-2.50$10-151MKodlama, kompleks promptlar
Gemini 2.5 Flash$0.30$2.501MHızlı, maliyet verimli
Gemini 2.5 Flash-Lite$0.10$0.401MEn yüksek verimlilik
Gemini 2.0 Flash$0.10$0.401MUltra hızlı, bütçe seçeneği

Görevi İşi Gören En Ucuz Modele Yönlendirmek#

Yaygın hata, gerekmediği halde premium model kullanmaktır:

Görev TipiYanlış SeçimDoğru SeçimMaliyet Tasarrufu
Basit Q&A, FAQOpus 4.5 ($5)Haiku 4.5 ($1)5x
Doküman sınıflandırmaSonnet 4.5 ($3)GPT-4o-mini ($0.15)20x
Metin özetlemeGPT-4o ($2.50)Gemini Flash ($0.30)8x
Kod reviewHaiku ($1)Sonnet 4.5 ($3)Kalite iyileştirme
Finansal analizHaiku ($1)Opus/o3 ($5)Risk azaltma
Kompleks akıl yürütmeSonnet ($3)o3 ($2)Daha iyi doğruluk

Üretimde bu eşleştirmenin yeri koddur; ucuz bir sınıflandırıcı her isteğin nereye gideceğine karar verir:

interface ModelRouter {
  // Gelen istek karmaşıklığını sınıflandır
  classifier: {
    model: "haiku-4.5"; // Sınıflandırmak için ucuz model kullan
    categories: ["simple", "medium", "complex", "critical"];
  };

  // Uygun modele yönlendir
  routing: {
    simple: {
      model: "gpt-4o-mini",
      costPer1M: 0.15,
      useCases: ["FAQ", "formatlama", "siniflandirma"]
    };
    medium: {
      model: "sonnet-4.5",
      costPer1M: 3.00,
      useCases: ["ozetleme", "kod-review", "analiz"]
    };
    complex: {
      model: "o3",
      costPer1M: 2.00,
      useCases: ["akil-yurutme", "matematik", "cok-adimli"]
    };
    critical: {
      model: "opus-4.5",
      costPer1M: 5.00,
      useCases: ["finansal-kararlar", "uyumluluk", "hukuki"]
    };
  };
}

Basit

Orta

Kompleks

Kritik

Kullanıcı İsteği

Karmaşıklık Sınıflandırıcı Haiku - $0.001

Karmaşıklığa Göre Yönlendir

GPT-4o-mini $0.15/1M

Sonnet 4.5 $3/1M

o3 $2/1M

Opus 4.5 $5/1M

Token Faturasını Küçültmek#

İki kaldıraç kod değişikliği istemiyor. Hem Anthropic hem OpenAI toplu işlemede %50 indirim sunar; doküman pipeline’ları, gece analiz işleri ve toplu sınıflandırma buna uygundur. Anthropic ise önbellek okumalarını temel input fiyatının %10’una fiyatlandırır; tekrarlanan sistem prompt’ları, ortak context blokları ve sabit bilgi tabanlı RAG’de karşılığını verir.

Üçüncü kaldıraç kaskad: en ucuz modelle başla, yalnızca başarısızlıkta yükselt.

async function cascadeQuery(prompt: string): Promise<string> {
  // Önce ucuz modeli dene
  const haiku = await query("haiku-4.5", prompt);
  if (haiku.confidence > 0.8) return haiku.response;

  // Orta seviyeye yükselt
  const sonnet = await query("sonnet-4.5", prompt);
  if (sonnet.confidence > 0.9) return sonnet.response;

  // Kompleks durumlar için son yükseltme
  return await query("opus-4.5", prompt);
}

Context boyutu sessiz kalemdir. Çoğu chatbot etkileşimi 128K pencereden (GPT-4o-mini) taşmaz, doküman Q&A 200K’lık Claude modellerine rahat sığar, 1M seçenekleri (Gemini Pro, GPT-4.1) ise fiyatını ancak tam kod tabanı analizi gibi işlerde hak eder.

Hangi Seviyede Hangi Model#

SeviyeBütçe ModelStandart ModelPremium Model
L1ChatGPT FreeClaude Pro ($20/ay)ChatGPT Plus ($20/ay)
L2-Claude Team ($25/kul.)ChatGPT Business ($30/kul.)
L3GPT-4o-mini APISonnet 4.5 APIo3 API
L4Haiku + Titan EmbedSonnet + TitanOpus + Cohere
L5Yönlendirme için HaikuAgent’lar için SonnetKritik için Opus
L6Fine-tuned küçükFine-tuned ortaÖzel büyük

Pratikte üretim trafiğinin büyük kısmı bütçe sütununda çalışabiliyor, premium sütun da bunu gerçekten gerektiren istekler için ayrılıyor.

Varsayılanın Bittiği Yer#

L2, içeriği sabit olan, PII taşımayan ve 50 kullanıcının altında kalan dahili bilgi işleri için varsayılan olmayı sürdürür. Yukarı çıkmak için kanıtın somut olması gerekir: kendi test setinde düşen getirme kalitesi, context limitini aşan bir bilgi tabanı, düzenleyicinin soracağı bir denetim izi ya da PII’yi kapsama sokan bir veri sınıflandırması. Tek bir yüklü PDF’in yanıtlayacağı sorular için L4 pipeline’ı kurduğunu fark ettiğinde ise aşağı in.

Kaynaklar#

İlgili yazılar