RAG mi, Fine-Tuning mi, Hazır AI mi? Kurumsal Karar Rehberi
Kurumsal AI entegrasyonu için pratik 6 seviyeli framework: ChatGPT, RAG, MCP agent veya fine-tuning ne zaman kullanılmalı, PII ve finans uyumluluğu odaklı.
Kurumsal AI benimseme süreci tahmin edilebilir bir patern izler: ekipler basit alternatifleri doğrulamadan sofistike mimarilere yönelir. L1’deki doğrudan sohbetten L6’daki fine-tuning’e uzanan altı seviyeli bir merdiven, bu seçenekleri arkalarındaki iş ihtiyacıyla karşılaştırmayı kolaylaştırır. Varsayılan, çoğu yol haritasının sandığından daha aşağıdadır. L2, yani yüklü bilgi dosyalarıyla bir sistem prompt’u, hak ettiğinden fazla dahili senaryoyu çözer; yukarı ancak ölçülmüş bir kısıtlama seni zorladığında çıkarsın.
Bu varsayılanı iki kısıt geçersiz kılar. PII pazarlıksız bir mimari sınırdır: kişisel veri akışa girdiği anda, ne kadar uygun görünürse görünsün L1 ve L2 masadan kalkar. Bu sınırın devreye girmediği yerlerde merdivende yukarı çıkmak, olay bazında tartabileceğin bir maliyet ve karmaşıklık kararına dönüşür. İkinci kısıt finansal hizmetlerde devreye giriyor: GDPR ve KVKK’nın üzerine denetim izi, açıklanabilirlik ve insan gözetimi düzenleyici zorunluluk olarak ekleniyor.
Tarayıcı Sekmesinden Eğitilmiş Modele Altı Seviye#
Merdivende her basamak yukarısı yetenek kazandırır; bedelini karmaşıklık, geliştirme süresi ve operasyon yüküyle ödersin.
Tarayıcı Sekmesi ve Yüklenen Dosya (L1 ve L2)#
L1 bir tarayıcı sekmesi: ChatGPT, Claude ya da benzeri bir servis, doğrudan kullanılıyor. Entegrasyon yok, özelleştirme yok, bağlam elle yapıştırılıyor. Kullanıcı başına aylık $20-60 ve sıfır geliştirme süresiyle bireysel üretkenlik işlerinin doğal adresi: yazma, beyin fırtınası, kod inceleme, kamuya açık bilgi üzerinde araştırma, prompt prototipleme, ad-hoc teknik sorular.
Sınırlar bu basitliğin öbür yüzü. Oturumlar arasında hiçbir şey kalıcı değil, denetim izi yok, iş sistemlerine bağlanan bir şey yok ve yapıştırdığın her şey, PII dahil, üçüncü taraf bir sağlayıcının altyapısına gidiyor.
// L1 yeterli olduğunda
// Senaryo: Geliştirici algoritma optimizasyonu yardımı istiyor
// Kullanıcı Claude'a doğrudan yapıştırıyor:
const prompt = `
Büyük dizilerde yavaş çalışan sıralama fonksiyonum var.
Optimizasyon önerebilir misin?
function bubbleSort(arr) {
for (let i = 0; i < arr.length; i++) {
for (let j = 0; j < arr.length - i - 1; j++) {
if (arr[j] > arr[j + 1]) {
[arr[j], arr[j + 1]] = [arr[j + 1], arr[j]];
}
}
}
return arr;
}
`;
// API gerekmiyor, altyapı gerekmiyor, geliştirme süresi gerekmiyor
// Bu kullanım senaryosu için doğru seviye bu
L2 aynı tarayıcı sekmesinde kalır, üzerine iki şey ekler: özel bir sistem prompt’u ve yüklenen bilgi dosyaları. Bu ikisi genel asistanı uzmanlaşmış bir asistana çevirir; kullanıcı başına aylık $25-60’lık Team veya Enterprise katmanında 2-8 saatlik bir kurulumla. Sabit içerikli dahili bilgi tabanları, kamuya açık politika Soru-Cevap’ı, işe alım asistanları, teknik dokümantasyon arama ve ürün SSS sistemleri buraya sığar.
# Örnek Claude Project Yapılandırması
Name: "Uyumluluk Politikası Asistanı"
System Prompt: |
Organizasyonumuz için bir uyumluluk asistanısın.
Bilgin yüklü politika belgeleriyle sınırlı.
Kurallar:
- Sadece yüklü belgelere dayalı soruları yanıtla
- Bilgi belgelerde yoksa, açıkça söyle
- Her zaman kaynak belgeyi ve bölümü belirt
- Asla politika veya prosedür uydurma
- Kapsam dışındaki sorular için compliance@company.com'a yönlendir
Knowledge Files:
- calisan-el-kitabi-2025.pdf (150 sayfa)
- kara-para-aklama-politikasi.pdf (80 sayfa)
- veri-koruma-yonergeleri.pdf (45 sayfa)
Context Window Kullanımı:
- System prompt: ~500 token
- Bilgi getirme: ~50,000 token (dinamik yüklenen)
- Konuşma geçmişi: ~20,000 token
- Yanıt için mevcut: ~129,500 token (Claude 200K)
L2 Yeterlilik Kontrol Listesi:
- İçerik çoğunlukla statik (güncellemeler haftada birden az)
- PII veya hassas iş verisi gerekmiyor
- Bilgi tabanı token limitlerinin içinde
- Gerçek zamanlı sistem entegrasyonu gerekmiyor
- Takım boyutu 50 kullanıcının altında
- Düzenleyici denetim izi gereksinimleri yok
n8n, Make ve Zapier İçinde AI Çağrıları (L3)#
L3’te iş akışı platformları AI çağrılarını otomasyonların içine yerleştirir; modeller özel geliştirme olmadan iş sistemlerine bağlanır. Aylık $50-600 platform maliyeti artı API giderleri ve bir-iki haftalık kurulum bekle.
Platform karşılaştırması:
| Özellik | n8n | Make | Zapier |
|---|---|---|---|
| Self-hosting | Evet | Hayır | Hayır |
| SOC 2 | Evet (Cloud) | Evet | Evet |
| GDPR Uyumluluk | Evet (self-host) | Evet | Evet |
| Min Takım Maliyeti | $25/ay | $16/ay | $20/ay |
| En Uygun | Kontrol, karmaşık akışlar | Denge | Basitlik |
Bu seviye kendini yüksek hacimli tekrar eden görevlerde, çoklu sistem orkestrasyonunda ve olay tabanlı yanıtlarda amorti eder; özellikle ayrı bir AI mühendisliği kapasitesi olmayan ekipler için.
// n8n iş akışı örneği: Destek bileti sınıflandırma
const ticketClassificationWorkflow = {
// Node 1: Webhook yeni Zendesk bileti alıyor
trigger: {
type: "webhook",
source: "zendesk"
},
// Node 2: AI sınıflandırma
aiClassification: {
prompt: `
Bu destek biletini bir kategoriye sınıflandır:
- billing: Ödeme, fatura, abonelik sorunları
- technical: Ürün hataları, API hataları, entegrasyon problemleri
- account: Giriş, izinler, profil güncellemeleri
- sales: Fiyatlandırma soruları, yükseltmeler, kurumsal talepler
Bilet Konusu: {{ticket.subject}}
Bilet Açıklaması: {{ticket.description}}
JSON döndür: {"category": "...", "urgency": "low|medium|high"}
`
},
// Node 3: Sınıflandırmaya göre yönlendir
routing: {
billing: { queue: "fatura-takimi", sla: "24s" },
technical: { queue: "muhendislik-destek", sla: "4s" },
account: { queue: "musteri-basarisi", sla: "12s" },
sales: { queue: "satis-takimi", sla: "2s" }
}
};
// Ayda 5,000 bilet için maliyet:
// n8n Cloud: $25 + OpenAI API ~$10 = $35/ay
// vs. manuel yönlendirme: Günlük 2+ saat insan zamanı
L4’te Getirme Hattını Kendin Kurmak#
L4, gerçek mühendislik gerektiren ilk basamak: kendi kurduğun retrieval-augmented generation; vektör veritabanı, embedding modeli ve orkestrasyon koduyla. Pipeline üzerindeki tam kontrolün bedeli aylık $500-2000 altyapı ve 4-8 haftalık geliştirme.
Mimari genel bakış:
AWS Bedrock Knowledge Bases uygulaması:
import {
BedrockAgentRuntimeClient,
RetrieveAndGenerateCommand
} from "@aws-sdk/client-bedrock-agent-runtime";
interface RAGResponse {
answer: string;
citations: Array<{
source: string;
content: string;
score: number;
}>;
}
async function queryKnowledgeBase(
question: string,
knowledgeBaseId: string
): Promise<RAGResponse> {
const client = new BedrockAgentRuntimeClient({ region: "eu-west-1" });
const command = new RetrieveAndGenerateCommand({
input: { text: question },
retrieveAndGenerateConfiguration: {
type: "KNOWLEDGE_BASE",
knowledgeBaseConfiguration: {
knowledgeBaseId,
modelArn: "arn:aws:bedrock:eu-west-1::foundation-model/anthropic.claude-sonnet-4-5-20250929-v1:0",
retrievalConfiguration: {
vectorSearchConfiguration: {
numberOfResults: 10,
overrideSearchType: "HYBRID"
}
},
generationConfiguration: {
promptTemplate: {
textPromptTemplate: `
Sağlanan bağlama dayalı soruları yanıtlayan yardımcı bir asistansın.
Bağlam:
$search_results$
Soru: $query$
Talimatlar:
- Sadece sağlanan bağlama dayalı yanıtla
- Bağlam yanıtı içermiyorsa, söyle
- Her zaman kaynak belgeyi belirt
- Kısa ama kapsamlı ol
`
}
}
}
}
});
const response = await client.send(command);
return {
answer: response.output?.text || "Yanıt üretilemedi",
citations: response.citations?.map(c => ({
source: c.retrievedReferences?.[0]?.location?.s3Location?.uri || "Bilinmiyor",
content: c.retrievedReferences?.[0]?.content?.text || "",
score: c.retrievedReferences?.[0]?.score || 0
})) || []
};
}
Bu iş, bilgi tabanı L2’yi taşırdığında zorunlu hale gelir: 200K tokenı veya 20 dosyayı aşan içerik, günlük değişen belgeler, kendin kontrol etmen gereken chunking ya da getirme mantığı. Kalan tetikleyiciler uyumluluk kaynaklı ve biri bile yetiyor: sorgu ve yanıtların zorunlu denetim izi, kanıtlaman gereken veri yerleşimi ya da günde binin üzerinde sorgu.
Aylık maliyet dökümü (100K sorgu/ay):
| Bileşen | Servis | Maliyet |
|---|---|---|
| Vector DB | OpenSearch Serverless (2 OCU) | $350 |
| Embeddings | Titan (100K sorgu x 500 token) | $1 |
| LLM | Claude Sonnet (100K x 2K token) | $600 |
| Depolama | S3 (100GB belge) | $3 |
| Lambda | Sorgu işleme | $20 |
| Toplam | ~$980/ay |
MCP Üzerinden Araç Kullanan L5 Agent’ları#
L5 modele el kazandırır: Model Context Protocol (MCP) üzerinden araç erişimli agent’lar akıl yürütür, planlar ve sistemler arasında eylem alır.
Mimari paterni:
MCP Server uygulama örneği:
// Not: Bu örnek MCP SDK v1.x pattern'lerini kullanır
import { McpServer } from "@modelcontextprotocol/sdk/server/mcp.js";
import { StdioServerTransport } from "@modelcontextprotocol/sdk/server/stdio.js";
import { z } from "zod";
const server = new McpServer({
name: "musteri-destek-araclari",
version: "1.0.0"
});
// Araç: Email ile müşteri arama (sadece PII olmayan bilgi döndürür)
server.tool(
"lookup_customer",
{
email: z.string().email().describe("Müşteri email adresi")
},
async ({ email }) => {
const customer = await db.customers.findByEmail(email);
if (!customer) {
return {
content: [{
type: "text",
text: JSON.stringify({ found: false })
}]
};
}
// Sadece hassas olmayan müşteri bilgisi döndür
return {
content: [{
type: "text",
text: JSON.stringify({
found: true,
customer_id: customer.id,
tier: customer.subscription_tier,
account_status: customer.status
// Not: Tam isim, adres, ödeme bilgisi gibi PII yok
})
}]
};
}
);
// Araç: Bilet oluştur (yüksek öncelik insan onayı gerektirir)
server.tool(
"create_ticket",
{
customer_id: z.string(),
subject: z.string(),
description: z.string(),
category: z.enum(["billing", "technical", "account", "other"]),
priority: z.enum(["low", "medium", "high"])
},
async ({ customer_id, subject, description, category, priority }) => {
// Yüksek öncelik veya faturalama = insan onayı gerekli
if (priority === "high" || category === "billing") {
return {
content: [{
type: "text",
text: JSON.stringify({
status: "pending_approval",
message: "Bu bilet insan onayı gerektiriyor"
})
}]
};
}
const ticket = await db.tickets.create({
customer_id, subject, description, category, priority,
created_by: "ai-agent"
});
// Uyumluluk için denetim log kaydı
await auditLog.write({
action: "ticket_created_by_agent",
ticket_id: ticket.id,
timestamp: new Date()
});
return {
content: [{
type: "text",
text: JSON.stringify({ status: "created", ticket_id: ticket.id })
}]
};
}
);
async function main() {
const transport = new StdioServerTransport();
await server.connect(transport);
}
main();
L5’in sinyali, tek bir getirme geçişinin karşılayamadığı iş akışıdır: çok adımlı planlar, bağlama göre değişen araç seçimi, tek sorguda birden fazla sisteme dokunmak, koşullu karar ağaçları ya da akışın ortasında bir insan onayı adımı.
Fine-tuning ve L6’nın Neden Beklediği#
L6, kendi verin üzerinde eğitim demek; yalnızca prompting ile elde edilemeyen davranış için. Aylık $2000-10000 civarında başlar ve bünyede ML uzmanlığı varsayar; buraya getirilen senaryoların çoğu da zaten bir basamak aşağıya aittir.
Fine-tuning ne zaman gerçekten mantıklı:
| Senaryo | Neden Fine-tuning | Önce Dene |
|---|---|---|
| Uzman terminoloji | Model jargonu anlamıyor | Few-shot prompting |
| Tutarlı çıktı formatı | Sıkı formatlama gereksinimleri | Çıktı ayrıştırma |
| Düşük gecikme | Tek çıkarım vs RAG | Model damıtma |
| Ölçekte maliyet | Yüksek hacim, token başı pahalı | Daha küçük model |
| Tescilli bilgi | Harici API kullanılamaz | On-premises RAG |
Fine-tuning’den ne zaman kaçınmalı:
- Problem daha iyi prompting ile çözülebilir (önce few-shot dene)
- Veri sık değişiyor (yeniden eğitim pahalı)
- Küçük veri seti (1000’den az örnek) - overfitting riski
- Bütçe kısıtlamaları (AI için aylık $1000’in altında)
- Takım eğitim verisi kürasyon için ML uzmanlığı yok
PII: Pazarlıksız Mimari Sınır#
PII (Kişisel Tanımlanabilir Bilgi) mimarinin yapmak zorunda olduğu işi değiştirir. Aşağıdaki gereksinimlerin tamamı kanundan geldiği için, sistem ne kadar iyi çalışırsa çalışsın birini atlamak elinde bir uyumluluk ihlali bırakır.
Seviyeye göre PII işlem gereksinimleri:
PII ile L3 (minimum uygulanabilir):
interface L3PIIConfig {
platform: "n8n-self-hosted" | "enterprise-tier-with-dpa";
aiProvider: {
// Veri İşleme Anlaşması gerekli
dataProcessingAgreement: string;
dataResidency: "eu" | "tr" | "specific-region";
};
security: {
encryptionAtRest: true;
encryptionInTransit: true;
auditLogging: true;
};
compliance: {
retentionPolicy: "30-gun" | "gerektigi-kadar";
deletionProcedure: "belgelenmis-ve-test-edilmis";
};
}
PII ile L4 (önerilen):
interface L4PIIArchitecture {
vectorDatabase: {
// Self-hosted veya uygun DPA ile
provider: "opensearch-self-hosted" | "pgvector" | "qdrant-private";
encryption: {
atRest: "AES-256";
inTransit: "TLS-1.3";
keyManagement: "AWS-KMS" | "HashiCorp-Vault";
};
};
llmProvider: {
// VPC endpoint ile AWS Bedrock - veri public internet'e çıkmıyor
type: "aws-bedrock";
vpcEndpoint: true;
modelInvocationLogging: true;
};
dataHandling: {
// PII embedding öncesi tokenize edilmeli
preprocessing: "tokenization";
tenantIsolation: true;
rowLevelSecurity: true;
};
}
PII henüz akışta olmasa da olası görünüyorsa, mimariyi baştan ona göre kur: L4 düzeyinde altyapı, temel bir özellik olarak denetim loglama ve en başta verilmiş bir veri yerleşimi kararı. Sınıflandırma hiç değişmezse bu kontrollerin herhangi birini ilerleyen aşamada gevşetebilirsin.
Finansın GDPR Üstüne Eklediği#
Finansal hizmetlerin, genel GDPR uyumluluğunun kapsamadığı AI gereksinimleri vardır.
Düzenleyici çerçeve:
| Yetki Alanı | Temel Düzenlemeler | AI-Spesifik Gereksinimler |
|---|---|---|
| AB | GDPR, AI Act, MiFID II | Açıklanabilirlik, insan gözetimi |
| ABD | GLBA, FCRA, eyalet yasaları | Adil kredi, olumsuz işlem bildirimleri |
| Birleşik Krallık | UK GDPR, FCA kuralları | Tüketici Görevi, operasyonel dayanıklılık |
| Türkiye | KVKK, BDDK düzenlemeleri | Veri yerelleştirilmesi (sektöre özgü, bankacılıkta daha sıkı), özel kategoriler |
L1-L2’de finans ekipleri yine de kamuya açık veri üzerinde dahili araştırma yapabilir, müşteri içermeyen kodu inceleyebilir, genel iş metinleri yazabilir ve eğitim materyali hazırlayabilir. Müşteri veri analizi, işlem izleme, kredi kararları ve yatırım tavsiyesi ise bu seviyelerde genellikle yasaktır.
Finansa özgü L4+ gereksinimleri:
interface FinanceAIRequirements {
auditTrail: {
inputLogging: true;
modelVersionLogging: true;
outputLogging: true;
retentionPeriod: "7-yil"; // Düzenleyici minimum
};
explainability: {
humanReadableExplanations: true;
featureImportance: true;
adverseActionNotices: true; // Kredi kararları için
};
humanOversight: {
materialThreshold: 10000; // > $10K işlemler
appealProcess: true;
escalationPath: true;
};
modelRiskManagement: {
// SR 11-7 / OCC 2011-12'ye göre
modelValidation: "bagimsiz-takim";
ongoingMonitoring: true;
performanceTesting: "ucaylik";
};
}
GDPR/KVKK Uygulama Öncesi Kontrol Listesi:
- Yasal dayanak belirlendi (onay, sözleşme, meşru menfaat)
- Yüksek riskli işleme için Veri Koruma Etki Değerlendirmesi yapıldı
- Teknik önlemler uygulandı (şifreleme, erişim kontrolleri, denetim loglama)
- AI sağlayıcı ile Veri İşleme Anlaşması imzalandı
- Veri sahibi hakları prosedürleri belgelendi (erişim, silme, taşınabilirlik)
- İşleme faaliyeti VERBIS’te kaydedildi
- Gizlilik bildirimi AI işlemesini içerecek şekilde güncellendi
Bunların hiçbiri yayına çıktıktan sonra üstüne eklenemez. Model riski dokümantasyonu, baştan kurgulanmış açıklanabilirlik, önemli kararlarda döngüdeki insan, yedi yıllık denetim izi ve bağımsız doğrulama ilk tasarım turunu şekillendirmek zorunda.
Gereksinimden Seviyeye#
PII sınırı, finans gereksinimleri ve seviye limitleri tek bir akış şemasında toplanıyor:
Seviye seçim matrisi:
| Kullanım Senaryosu | Önerilen Seviye | Yükseltme Sinyali |
|---|---|---|
| Kişisel üretkenlik | L1 | Takım paylaşımlı erişim istiyor |
| Dahili SSS (küçük) | L2 | İçerik limitleri aşıyor |
| Dahili SSS (büyük) | L4 | Çoklu sistem verisi gerekli |
| Destek bileti yönlendirme | L3 | Karmaşık yönlendirme mantığı |
| Eylem alan destek agent’ı | L5 | Yok - doğru uyum bu |
| Uyumluluk belge kontrolü | L2-L3 | Denetim izi gerekli |
| Belge analizi | L4 | Alana özgü doğruluk |
| İşlem sınıflandırma | L6 | Ölçekte gecikme/maliyet kritik |
Önce L2 sürümünü yayına al, doğruluğu ve kullanıcı memnuniyetini ölç ve çarptığın somut sınırları not et. L4’ü yalnızca L2’nin ölçülebilir biçimde yetersiz kaldığı durumlar için kur; L2 asistanı da hâlihazırda iyi yanıtladığı basit sorgulara bakmayı sürdürsün.
İki Proje, İki Zıt Hata#
Bir şirket 500 sayfalık çalışan el kitabı için AI asistanı istedi; mühendislik teklifi tam bir L4 kurulumuydu: OpenSearch, özel embedding pipeline’ı, 8 haftalık takvim. Gereksinim analizi başka bir şey söylüyordu:
- 500 sayfa = ~250K token (Claude’un bağlam penceresinin içinde)
- Güncellemeler: üç ayda bir el kitabı revizyonu
- Kullanıcılar: 200 çalışan
- Denetim izi gereksinimi yok
L2 Claude Project işi karşıladı: 2 saatlik kurulum, aylık $5,000 ($25’lik Team planında 200 kullanıcı), el kitabı Soru-Cevap’ı için yeterli doğruluk. Tasarruf, 8 haftalık geliştirme artı süresiz çalışacak altyapıydı.
Zıt yöndeki hata daha ağır sonuç taşıyor. Bir fintech startup’ı, hızlı kurulduğu ve altyapı istemediği için müşteri işlem paterni analizini L1 ChatGPT üzerinden yürüttü. İşlem verisi PII’dir: OpenAI ile veri işleme anlaşması yoktu, düzenleyici incelemeye gösterilecek denetim izi yoktu ve veri her sorguda yetki alanının dışına çıkıyor olabilirdi. Bu eksiklerin her biri tek başına GDPR ve KVKK riski taşıyor. Bu iş yükünün tabanı AWS Bedrock üzerinde L4: veri AWS içinde kalsın diye VPC endpoint, denetim izi için model çağrı loglaması, veri yerleşimi için AB/TR bölgesi.
Ayda 10K Sorguda Maliyet#
Orta ölçekli bir kurum için tahminler:
| Seviye | Altyapı | API/Kullanım | Geliştirme Süresi (Tek Seferlik) | Aylık Toplam |
|---|---|---|---|---|
| L1 | $0 | $400 (20 kul.) | 0 | $400 |
| L2 | $0 | $500 (20 kul.) | 8 saat | $500 |
| L3 | $100 | $50 | 40 saat | $150 |
| L4 | $500 | $300 | 160 saat | $800 |
| L5 | $1,000 | $800 | 320 saat | $1,800 |
| L6 | $2,500 | $500 | 400 saat | $3,000 |
Geliştirme maliyetleri tek seferlik; devam eden bakım L4’ten yukarısında aylık toplama eklenir.
Seviye İçinde Model Seçimi#
Seviye seçimi mimariyi sabitler ama birim ekonomiyi içeride hangi modelin çalıştığı belirler. Premium modeller çoğu zaman daha ucuzunun aynı kalitede yaptığı işlere yönlendiriliyor.
Ocak 2026 Model Fiyatları#
Anthropic Claude Modelleri:
| Model | Input (/1M) | Output (/1M) | Context | En Uygun |
|---|---|---|---|---|
| Opus 4.5 | $5.00 | $25.00 | 200K | Kompleks akıl yürütme, kritik kararlar |
| Sonnet 4.5 | $3.00 | $15.00 | 200K-1M | Kod analizi, RAG, genel amaç |
| Haiku 4.5 | $1.00 | $5.00 | 200K | Hızlı işler, sınıflandırma, basit Q&A |
| Haiku 3.5 | $0.80 | $4.00 | 200K | Bütçe işleri, yüksek hacim |
OpenAI Modelleri:
| Model | Input (/1M) | Output (/1M) | Context | En Uygun |
|---|---|---|---|---|
| GPT-4.1 | $2.00 | $8.00 | 1M | Genel amaç, geniş context |
| o3 | $2.00 | $8.00 | 200K | Kompleks akıl yürütme, matematik, kodlama |
| o4-mini | $1.10 | $4.40 | 200K | Hızlı akıl yürütme görevleri |
| GPT-4o | $2.50 | $10.00 | 128K | Multimodal, genel amaç |
| GPT-4o-mini | $0.15 | $0.60 | 128K | Bütçe işleri, basit operasyonlar |
Google Gemini Modelleri:
| Model | Input (/1M) | Output (/1M) | Context | En Uygun |
|---|---|---|---|---|
| Gemini 2.5 Pro | $1.25-2.50 | $10-15 | 1M | Kodlama, kompleks promptlar |
| Gemini 2.5 Flash | $0.30 | $2.50 | 1M | Hızlı, maliyet verimli |
| Gemini 2.5 Flash-Lite | $0.10 | $0.40 | 1M | En yüksek verimlilik |
| Gemini 2.0 Flash | $0.10 | $0.40 | 1M | Ultra hızlı, bütçe seçeneği |
Görevi İşi Gören En Ucuz Modele Yönlendirmek#
Yaygın hata, gerekmediği halde premium model kullanmaktır:
| Görev Tipi | Yanlış Seçim | Doğru Seçim | Maliyet Tasarrufu |
|---|---|---|---|
| Basit Q&A, FAQ | Opus 4.5 ($5) | Haiku 4.5 ($1) | 5x |
| Doküman sınıflandırma | Sonnet 4.5 ($3) | GPT-4o-mini ($0.15) | 20x |
| Metin özetleme | GPT-4o ($2.50) | Gemini Flash ($0.30) | 8x |
| Kod review | Haiku ($1) | Sonnet 4.5 ($3) | Kalite iyileştirme |
| Finansal analiz | Haiku ($1) | Opus/o3 ($5) | Risk azaltma |
| Kompleks akıl yürütme | Sonnet ($3) | o3 ($2) | Daha iyi doğruluk |
Üretimde bu eşleştirmenin yeri koddur; ucuz bir sınıflandırıcı her isteğin nereye gideceğine karar verir:
interface ModelRouter {
// Gelen istek karmaşıklığını sınıflandır
classifier: {
model: "haiku-4.5"; // Sınıflandırmak için ucuz model kullan
categories: ["simple", "medium", "complex", "critical"];
};
// Uygun modele yönlendir
routing: {
simple: {
model: "gpt-4o-mini",
costPer1M: 0.15,
useCases: ["FAQ", "formatlama", "siniflandirma"]
};
medium: {
model: "sonnet-4.5",
costPer1M: 3.00,
useCases: ["ozetleme", "kod-review", "analiz"]
};
complex: {
model: "o3",
costPer1M: 2.00,
useCases: ["akil-yurutme", "matematik", "cok-adimli"]
};
critical: {
model: "opus-4.5",
costPer1M: 5.00,
useCases: ["finansal-kararlar", "uyumluluk", "hukuki"]
};
};
}
Token Faturasını Küçültmek#
İki kaldıraç kod değişikliği istemiyor. Hem Anthropic hem OpenAI toplu işlemede %50 indirim sunar; doküman pipeline’ları, gece analiz işleri ve toplu sınıflandırma buna uygundur. Anthropic ise önbellek okumalarını temel input fiyatının %10’una fiyatlandırır; tekrarlanan sistem prompt’ları, ortak context blokları ve sabit bilgi tabanlı RAG’de karşılığını verir.
Üçüncü kaldıraç kaskad: en ucuz modelle başla, yalnızca başarısızlıkta yükselt.
async function cascadeQuery(prompt: string): Promise<string> {
// Önce ucuz modeli dene
const haiku = await query("haiku-4.5", prompt);
if (haiku.confidence > 0.8) return haiku.response;
// Orta seviyeye yükselt
const sonnet = await query("sonnet-4.5", prompt);
if (sonnet.confidence > 0.9) return sonnet.response;
// Kompleks durumlar için son yükseltme
return await query("opus-4.5", prompt);
}
Context boyutu sessiz kalemdir. Çoğu chatbot etkileşimi 128K pencereden (GPT-4o-mini) taşmaz, doküman Q&A 200K’lık Claude modellerine rahat sığar, 1M seçenekleri (Gemini Pro, GPT-4.1) ise fiyatını ancak tam kod tabanı analizi gibi işlerde hak eder.
Hangi Seviyede Hangi Model#
| Seviye | Bütçe Model | Standart Model | Premium Model |
|---|---|---|---|
| L1 | ChatGPT Free | Claude Pro ($20/ay) | ChatGPT Plus ($20/ay) |
| L2 | - | Claude Team ($25/kul.) | ChatGPT Business ($30/kul.) |
| L3 | GPT-4o-mini API | Sonnet 4.5 API | o3 API |
| L4 | Haiku + Titan Embed | Sonnet + Titan | Opus + Cohere |
| L5 | Yönlendirme için Haiku | Agent’lar için Sonnet | Kritik için Opus |
| L6 | Fine-tuned küçük | Fine-tuned orta | Özel büyük |
Pratikte üretim trafiğinin büyük kısmı bütçe sütununda çalışabiliyor, premium sütun da bunu gerçekten gerektiren istekler için ayrılıyor.
Varsayılanın Bittiği Yer#
L2, içeriği sabit olan, PII taşımayan ve 50 kullanıcının altında kalan dahili bilgi işleri için varsayılan olmayı sürdürür. Yukarı çıkmak için kanıtın somut olması gerekir: kendi test setinde düşen getirme kalitesi, context limitini aşan bir bilgi tabanı, düzenleyicinin soracağı bir denetim izi ya da PII’yi kapsama sokan bir veri sınıflandırması. Tek bir yüklü PDF’in yanıtlayacağı sorular için L4 pipeline’ı kurduğunu fark ettiğinde ise aşağı in.
Kaynaklar#
- Model Context Protocol Spesifikasyonu (yeni sekmede açılır) - Araç destekli LLM ajan entegrasyonu için resmi MCP spesifikasyonu
- MCP TypeScript SDK (yeni sekmede açılır) - MCP sunucuları ve istemcileri oluşturmak için referans implementasyon
- OpenTelemetry Spesifikasyonu (yeni sekmede açılır) - Yapay zeka ajan iş akışlarını izlemek için gözlemlenebilirlik standardı
- AWS Secrets Manager (yeni sekmede açılır) - Kurumsal yapay zeka entegrasyon kimlik bilgileri için yönetilen sır hizmeti
- Amazon Cognito Kullanıcı Havuzları (yeni sekmede açılır) - Çok kiracılı kurumsal yapay zeka uygulamaları için kimlik yönetimi
- OAuth 2.0 Yetkilendirme Çerçevesi - RFC 6749 (yeni sekmede açılır) - Yetkilendirilmiş erişim gerektiren API düzeyinde yapay zeka entegrasyonları için yetkilendirme standardı
- AWS KMS Anahtar Yönetim Servisi (yeni sekmede açılır) - KVKK ve finans verisi uyumluluğu için müşteri tarafından yönetilen şifreleme anahtarları
- Amazon Bedrock Knowledge Bases (yeni sekmede açılır) - L4 getirme örneğinin arkasındaki yönetilen RAG servisi; vektör deposu ve veri alım seçenekleri
- Anthropic Model Fiyatlandırması (yeni sekmede açılır) - Seçim tablolarında kullanılan Claude model ailesinin token başı liste fiyatları
- OpenAI API Fiyatlandırması (yeni sekmede açılır) - GPT ve o-serisi modeller için token başı fiyatlandırma ve context limitleri
- Gemini API Fiyatlandırması (yeni sekmede açılır) - Gemini model ailesi için token başı fiyat katmanları
- GDPR Tam Metni (EUR-Lex) (yeni sekmede açılır) - Yasal dayanak, etki değerlendirmesi ve veri sahibi haklarını kapsayan resmi (AB) 2016/679 tüzük metni
İlgili yazılar
AI/LLM alanında pratik, implementation odaklı bir sözlük. Token'lardan agent'lara, RAG'dan fine-tuning'e, kod örnekleri ve dürüst değerlendirmelerle.
llm · ai-agents · rag +6
MCP'nin AI tool entegrasyonunu nasıl standartlaştırdığını, TypeScript örnekleriyle server geliştirme, güvenlik yönetimi ve production performans optimizasyonunu öğren.
mcp · ai-adoption-strategy · claude +3
Zapier MCP'nin AI agent'lar için aksiyon bazlı beyaz liste, merkezi kimlik yönetimi ve insan onay mekanizması sunması. Özel proxy çözümlerine yönetilen bir alternatif.
mcp · security · ai-agents +4
Production takımları geniş MCP erişimini neden scoped API proxy'leriyle değiştirir? Atlassian, Google Workspace ve Notion için FastAPI, CLI ve n8n örnekleri.
mcp · api-design · python +4
Model Context Protocol için kurumsal kalıplar: araç bileşimi, çoklu ajan orkestrasyonu, rol tabanlı erişim kontrolü ve production gözlemlenebilirlik.
mcp · ai-adoption-strategy · authorization +4