AI RAG Chunking & Embedding Visualizer
Dokümanlarınızı RAG mimarileri için dilimleyin, örtüşen bağlam bölgelerini canlı inceleyin ve embedding maliyetini hesaplayın.
RAG Mimarilerinde Doğru Chunking (Metin Dilimleme) Neden Hayatidir?
RAG (Retrieval-Augmented Generation) sistemlerinin başarısı, doğrudan vektör veritabanına kaydedilen metin parçalarının (chunk) kalitesine bağlıdır. Büyük Dil Modelleri (LLM), sınırlı bağlam pencerelerine (context window) sahiptir ve gereksiz gürültü içeren büyük parçalar modelin "iğneyi samanlıkta arama" (Lost in the Middle) problemine düşmesine sebep olur.
Öte yandan, aşırı küçük dilimlenen metinler cümlenin veya fikrin anlam bağlamını (semantic context) yok eder. Bu görselleştirici araç; Recursive Character, Sentence-Aware ve Markdown Header stratejileriyle dokümanlarınızı tarayıcınızda canlı olarak parçalar, örtüşme (overlap) payını renkli katmanlarla gösterir ve OpenAI ile Cohere embedding maliyetlerinizi kuruşu kuruşuna hesaplar.
Popüler Chunking Stratejileri ve Kullanım Senaryoları
📐 Recursive Character Splitter
LangChain ve LlamaIndex için endüstri standardıdır. Metni sırasıyla çift satırbaşı (\n\n), tek satırbaşı (\n), nokta (. ) ve boşluk karakterlerinden bölerek doğal paragraf ve cümle sınırlarını azami ölçüde korur.
📝 Markdown Header Splitter
Teknik belgeler, API referansları ve Notion dokümanları için idealdir. H1 (#), H2 (##) ve H3 (###) başlıklarını ve altındaki açıklamaları bir arada tutarak hiyerarşik bağlam kaybını sıfıra indirir.
🔄 Chunk Overlap Önemi
Parçalar arasında %10 ila %20 arasında örtüşme (overlap) bırakmak, iki parça arasına denk gelen kritik bir bilginin veya formülün bağlam kopukluğu yaşamadan her iki vektör parçasında da yaşamasını sağlar.
RAG & Embedding Sıkça Sorulan Sorular (SSS)
İdeal RAG chunk boyutu (Chunk Size) kaç token olmalıdır?↓
Genel amaçlı RAG uygulamalarında en yaygın tercih edilen boyut 256 ila 512 token aralığıdır. Soru-cevap (FAQ) odaklı aramalarda 128-256 token yeterliyken; karmaşık mantık, sözleşme veya kod blokları içeren dokümanlarda 512-1024 token tercih edilir.
OpenAI text-embedding-3-small ile text-embedding-3-large arasındaki fark nedir?↓
text-embedding-3-small 1536 vektör boyutuna (dimension) sahip olup 1 milyon token başına $0.02 gibi son derece ekonomik bir maliyete sahiptir ve çoğu web uygulaması için fazlasıyla yeterlidir.text-embedding-3-large ise 3072 boyutuyla çok dilli ve derin semantik nüans gerektiren hukuk veya akademik projelerde daha yüksek benzerlik doğruluğu (MTEB skoru) sunar.
Chunk verilerini PostgreSQL / Supabase pgvector ile nasıl saklarım?↓
Ürettiğiniz JSON çıktısındaki parçaları bir veritabanı tablosunda content TEXT ve embedding vector(1536) sütunları ile saklayabilirsiniz. Sorgularda milisaniye hızında benzerlik aramak için HNSW veya IVFFlat indeksi tanımlamanız önerilir.