LLM Gözlemlenebilirliği ve OpenTelemetry: Kurumsal Yapay Zekâ Sistemleri İçin Üretim Ortamında İzleme Altyapısı Kurmak
Kurumsal mimarlar için OpenTelemetry GenAI semantik kurallarını, dağıtık izlemeyi (distributed tracing), jeton (token) maliyet tahsisini ve gizlilik odaklı veri temizlemeyi canlı LLM iş akışlarında uygulama rehberi.

Kurumsal yapay zekâ uygulamaları tek istemli (single-prompt) sohbet botlarından canlı ortamdaki çoklu agent (multi-agent) iş akışlarına dönüşürken, geleneksel Uygulama Performans İzleme (APM) araçları temel düzeyde yetersizliklerle karşılaşmaktadır. Durum kodları ve genel istek gecikmesi gibi geleneksel HTTP metrikleri; Üretken Yapay Zekâ mimarisinin doğasında bulunan belirleyici olmayan (non-deterministic) akıl yürütme döngülerini, jeton (token) kullanım maliyetlerini, model parametrelerini ve çok adımlı araç çağrılarını yakalamada başarısız olur. Sağlayıcıdan bağımsız (vendor-agnostic) dağıtık izleme (distributed tracing) olmadan mühendislik ekipleri; kara kutu canlı ortam hataları, öngörülemeyen jeton tüketimi ve denetlenmeyen veri sızıntılarıyla karşı karşıya kalır. Kurumsal telemetriyi OpenTelemetry (OTel) GenAI semantik kuralları etrafında standartlaştırmak; herhangi bir sağlayıcıya bağımlı kalmadan (vendor lock-in) gerçek zamanlı rota görselleştirmesi, hassas maliyet tahsisi ve katı veri yükü temizleme sunan evrensel ve geleceğe uyumlu bir gözlemlenebilirlik temeli sağlar.
Geleneksel APM Kurumsal Üretken Yapay Zekâ İş Akışlarında Neden Yetersiz Kalır?
Standart APM platformları, gelen bir isteğin öngörülebilir veritabanı sorgularına ve sonraki REST çağrılarına dönüştüğü belirleyici (deterministic) mikroservisler etrafında tasarlanmıştır. Üretken Yapay Zekâ mimarisinde ise tek bir kullanıcı girdisi; dinamik bir model çağrıları zincirini, vektör veritabanı sorgularını, harici API yürütmelerini ve yinelemeli yeniden deneme (retry) döngülerini tetikleyebilir.
Geleneksel APM araçları bu karmaşık yürütmeleri bir LLM sağlayıcısı uç noktasına yapılan düz ve uzun süreli HTTP POST istekleri olarak kaydeder. Bu durum operasyonel görünürlükte ciddi eksiklikler yaratır:
- Belirleyici Olmayan Yürütme Rotaları: İki özdeş kullanıcı istemi, ara model çıktılarına bağlı olarak tamamen farklı araç rotaları veya akıl yürütme zincirleri çalıştırabilir.
- Gizli Gecikme Darboğazları: İlk jeton süresi (Time-to-First-Token - TTFT), vektör arama gömme (embedding) erişimi, araç çalıştırma ve üretim debisi tek bir şeffaf olmayan süre metriği içinde birleştirilir.
- Yakalanamayan Jeton Ekonomisi: Standart HTTP başlıkları; istem jetonlarını, tamamlama jetonlarını veya önbelleğe alınmış jeton eşleşmelerini izlemez; bu da departmanlar veya kiracı (tenant) hesapları arasında doğru maliyet dağıtımını engeller.
- Eksik Akıl Yürütme Rotaları: Otonom bir agent sonsuz bir döngüye girdiğinde veya geçersiz bir araç seçtiğinde, geleneksel günlük kaydı (logging) hata noktasını incelemek için gereken üst-alt (parent-child) span hiyerarşisinden yoksundur.
Otonom Yapay Zekâ İş Akışı Mimarisi rehberimizde ele aldığımız gibi, dağıtım öncesi değerlendirme çerçeveleri ve çevrimdışı CI/CD rota kıyaslamaları sistem davranışını yayından önce doğrulasa da; canlı ortam gözlemlenebilirliği, her canlı isteğinde gerçek zamanlı dağıtık span takibi gerektirir. Sektörün sağlayıcıdan bağımsız OpenTelemetry standartlarına kayması, kurumsal gözlemlenebilirliğin belirli model sağlayıcılarından veya görselleştirme arka uçlarından bağımsız kalmasını sağlar.
İlgili: Model Context Protocol (MCP): AI Agent'larını Eski Sistemlere Güvenle Bağlamak
OpenTelemetry GenAI Standardı: Span'ler ve Metrikler İçin Semantik Kurallar
Parçalanmış ve sağlayıcıya özel günlük biçimlerini çözmek amacıyla OpenTelemetry Projesi, Üretken Yapay Zekâ sistemlerine özel standartlaştırılmış semantik kurallar yayınlamıştır. gen_ai.* özniteliklerinin benimsenmesi, tüm modeller, çerçeveler ve bulut ortamları arasında tek tip bir taksonomi oluşturur.
OpenTelemetry GenAI spesifikasyonuna göre her model çağrısı, standartlaştırılmış meta verilerle zenginleştirilmiş bir span olarak temsil edilir:
OpenTelemetry GenAI Span Öznitelik Yapısı
├── gen_ai.provider.name # "openai", "anthropic", "ollama", vb.
├── gen_ai.request.model # "gpt-4o", "claude-3-5-sonnet", vb.
├── gen_ai.request.temperature # Model üretim parametreleri
├── gen_ai.request.top_p # Nucleus örnekleme değeri
├── gen_ai.usage.input_tokens # İstem (prompt) jeton sayısı
├── gen_ai.usage.output_tokens # Tamamlama (completion) jeton sayısı
└── gen_ai.response.finish_reasons # ["stop", "length", "tool_calls"]
OpenTelemetry GenAI spesifikasyonunda tanımlanan temel öznitelikler şunları içerir:
- Sağlayıcı ve Model Tanımlayıcıları:
gen_ai.provider.namehedef yapay zekâ sağlayıcısını kaydederken,gen_ai.request.modelvegen_ai.response.modelistenen ve fiilen hizmet veren model sürümünü izler. - Jeton Kullanım Metrikleri:
gen_ai.usage.input_tokensvegen_ai.usage.output_tokens, her bir tamamlama çağrısı için kesin kaynak tüketimini yakalar. - Yürütme Parametreleri:
gen_ai.request.temperature,gen_ai.request.max_tokensvegen_ai.request.top_p, davranışsal değişiklikleri denetlemek için üretim ayarlarını kaydeder. - Tamamlama Durumları:
gen_ai.response.finish_reasons, üretimin neden sona erdiğini kaydederek jeton sınırı kesintilerini veya araç çağrısı tetikleyicilerini açığa çıkarır.
Kurumlar bu semantik kuralları uygulama katmanında veya API ağ geçidinde uygulayarak, platform değiştirirken enstrümantasyon kodunu yeniden yazmak zorunda kalmadan telemetri verilerini Langfuse gibi açık kaynaklı platformlar veya Datadog gibi kurumsal APM'ler dâhil uyumlu herhangi bir arka uca sorunsuz bir şekilde yönlendirebilir.
İlgili: Web Sitesi Yapay Zekâ Asistanı Gerçekte Ne Kadara Mal Olur? Toplam Maliyet Çalışma Tablosu
Çok Adımlı Agent Rotalarında Dağıtık İzleme Uygulama
Kurumsal yapay zekâ iş akışları nadiren tek bir LLM isteğinden oluşur. Canlı ortam agentic mimarileri çok adımlı rotalar içerir: kullanıcı sorgusunu alma, gömme (embedding) vektörleri üretme, Bilgi Getirme Destekli Üretim (RAG) için bir vektör deposunu sorgulama, Model Context Protocol (MCP) üzerinden harici bir aracı çağırma, ara sonuçları değerlendirme ve nihai yanıtı sentezleme.
Dağıtık izleme, W3C Trace Context başlıklarını (traceparent ve tracestate) kullanarak yürütme bağlamını bu çoklu servis sınırları boyunca korur. Bu hiyerarşi, izole edilmiş eylemleri uçtan uca bir yürütme ağacına bağlar:
Kök Span: Müşteri Destek Agent'ı Rotası (TraceID: 4bf92f35)
├── Span 1: Vektör Arama Gömme (Embedding) Üretimi (gen_ai.provider.name: openai)
├── Span 2: Vektör Veritabanı Sorgusu (db.system: qdrant, gecikme: 45ms)
├── Span 3: LLM Akıl Yürütme Adımı (gen_ai.provider.name: anthropic, input_tokens: 1240)
│ └── Alt Span 3.1: MCP Araç Çalıştırma (tool.name: fetch_account_balance)
└── Span 4: Nihai Yanıt Üretimi (gen_ai.provider.name: anthropic, output_tokens: 310)
Çok adımlı yürütme ağaçlarını görselleştirmek, mühendislik ekiplerinin kritik performans kalıplarını tanımlamasını sağlar:
- Gecikme Dağılımı: Geciken yanıtların yavaş vektör erişiminden mi, model kuyruğundan mı yoksa üçüncü taraf araç yürütmesinden mi kaynaklandığını tam olarak belirleyin.
- Agent Rota Sapması: Otonom bir agent'ın verimsiz bir alt hedef yolu izlediği veya yinelemeli araç çağrıları başlattığı noktaları tespit edin.
- Hata Yayılımı: Alt akıştaki bir veritabanı zaman aşımının veya hatalı biçimlendirilmiş JSON araç yanıtının kullanıcı arayüzüne nasıl yayıldığını izleyin.
İlgili: KVKK ve Yapay Zekâ: Türk Şirketleri ChatGPT'ye Neyi Gönderebilir, Neyi Gönderemez
Gizlilik Odaklı Telemetri: Canlı Ortam Veri Yükü Temizleme ve Yönetişim
Ham LLM girdilerini ve çıktılarını yakalayan telemetri akışları, önemli güvenlik ve uyumluluk riskleri oluşturur. İstemler sıklıkla ticari sırlar, müşteri detayları veya kişisel veriler içerir. Maskelenmemiş veri yükü akışlarını doğrudan harici telemetri arka uçlarına göndermek, KVKK veya GDPR gibi veri koruma düzenlemelerini ihlal edebilir.
Kurumsal gözlemlenebilirlik mimarileri, kurum içi ağ sınırları içinde çalışan gizlilik odaklı bir toplayıcı (collector) hattı uygular. Telemetri span'leri dahili ağdan çıkmadan önce, hatta yer alan bir OpenTelemetry Collector veri yükü içeriğini dönüştürür ve temizler:
[ LLM Uygulaması ] ──(Ham İzler + İstemler)──> ┌──────────────────────────────────────┐
│ OTel Collector (Kurum İçi Sınırda) │
│ ├── PII Temizleme Filtresi │
│ ├── Sistem İstem Maskeleme │
│ └── Regex Jeton Anonimleştirme │
└──────────────────────────────────────┘
│
(Temizlenmiş İzler & Span'ler)
▼
[ Kurumsal APM / İzleme Arka Ucu ]
Temel canlı ortam temizleme kontrolleri şunları içerir:
- PII ve Hassas Veri Maskeleme: OpenTelemetry Collector içindeki kalıp eşleme işlemcilerini kullanarak T.C. kimlik numaralarının, kredi kartı jetonlarının, kişisel e-posta adreslerinin ve müşteri isimlerinin otomatik olarak temizlenmesi.
- Yapılandırılabilir Veri Yükü Yakalama: Canlı telemetriyi kesinlikle meta veriler, span süreleri ve jeton sayıları ile sınırlandırırken, canlı öncesi test ortamlarında tam istem-tamamlama metnini kaydetme yeteneği.
- Sistem İstemi Koruması: Fikri mülkiyet sızıntılarını önlemek için dahili sistem talimatlarının ve özel bağlam dokümanlarının kamuya açık APM günlük akışlarından otomatik olarak bastırılması.
- Rol Tabanlı Telemetri Kapsamlandırması: Mühendislere toplu metrik erişimi sağlarken, ayrıntılı istem izleme yüklerine erişimi yetkili güvenlik ve yapay zekâ güvenlik ekipleriyle sınırlandırma.
İlgili: Kurumsal Yapay Zekâ ROI Çerçevesi: Pilot Arafının Ötesinde Finansal Modeller, TCO ve Değer Ölçümü
Gerçek Zamanlı Jeton Maliyet Tahsisi ve Gecikme Hata Ayıklama
Kurumsal LLM dağıtımındaki birincil zorluk, değişken operasyonel maliyetleri yönetmektir. Model sağlayıcıları jeton başına ücret aldığından, denetlenmeyen arka plan agent'ları veya optimize edilmemiş istem şablonları tahsis edilen bütçeleri hızla aşabilir.
Telemetriyi OpenTelemetry gen_ai.usage.* öznitelikleri üzerinde standartlaştırarak, finans ve platform mühendisliği ekipleri gerçek zamanlı maliyet tahsis panoları oluşturabilir:
- İzleme Başına Maliyet Toplama: İşlem, müşteri isteği veya iş birimi başına kesin finansal maliyeti hesaplamak için kaydedilen
input_tokensveoutput_tokensdeğerlerini sağlayıcı birim fiyatlarıyla çarpmak. - Kiracı ve Departman Etiketleme: Hassas dahili maliyet yansıtma (showback ve chargeback) modellerini etkinleştirmek için kök span'lere bağlamsal öznitelikler (örn.
tenant.id,department.name,feature.flag) eklemek. - Önbellek Verimliliği Takibi: Yapılandırılmış istem mühendisliği ile elde edilen tasarrufları nicellendirmek için istem önbellek eşleşmelerini ve bağlamın yeniden kullanımını izlemek.
Finansal görünürlüğe ek olarak, ilişkilendirilmiş telemetri gecikme hata ayıklamasını da basitleştirir. Toplam istek süresini İlk Jeton Süresi (TTFT) ve Üretim Debisi (saniye başına jeton) olarak ikiye bölmek, ekiplerin gecikme sorunlarının ilk istem işleme yükünden mi yoksa model sunucusundan yavaş jeton akışından mı kaynaklandığını belirlemesine olanak tanır.
Kurumsal Yapay Zekâ Gözlemlenebilirliğinde Sonraki Adımlar
Temel günlük kaydından standartlaştırılmış OpenTelemetry izlemesine geçiş yapmak, kurumsal yapay zekâ uygulamalarını güven, güvenlik ve maliyet kontrolü ile ölçeklendirmek için kritik önem taşır.
Kurumunuz canlı ortam LLM iş akışlarını ölçeklendiriyorsa veya sağlayıcıdan bağımsız yapay zekâ telemetrisi uygulamak istiyorsa, Orbitra AI uzman mimari destek sunar:
- OpenTelemetry AI Hazırlık Denetimi: Bir OpenTelemetry GenAI geçiş stratejisi tasarlamak için mevcut yapay zekâ hatlarınızı, araç entegrasyon noktalarınızı ve telemetri altyapınızı değerlendirin.
- Özel Telemetri Hattı Mühendisliği: Satır içi PII temizleme, KVKK/GDPR uyumluluk filtreleme ve güvenli APM yönlendirmesi içeren özelleştirilmiş OpenTelemetry Collector mimarilerini uygulayın.
- Agent İzleme ve Maliyet Tahsisi Kurulumu: Gerçek zamanlı maliyet takip panoları ile çoklu agent sistemleri, vektör depoları ve özel MCP entegrasyonları genelinde uçtan uca dağıtık izlemeyi devreye alın.
Kurumsal yapay zekâ sistemleriniz için güvenli, sağlayıcıdan bağımsız bir gözlemlenebilirlik temeli oluşturmak üzere Bir Orbitra AI Mimarı ile görüşme planlayın.