TechnoRadical notları · Makale
Yapay zeka görünürlüğü nasıl ölçülür
Yapay zeka görünürlüğü ölçülür ama yapısal hazırlıkla karıştırılmamalı. Gerçek ölçüm yöntemleri, sınırları ve küçük işletme için karar çerçevesi.
Yapay zeka görünürlüğü ölçülebilir ama tek bir sayı değil, farklı yöntemlerle elde edilen birden fazla göstergedir: markanın veya sayfanın ChatGPT, Perplexity ve Google AI Overviews gibi üretken arama yüzeylerindeki anılma, atıf ve konum verisi. Piyasadaki “AI görünürlük ölçümü” araçlarının çoğu aslında bunu değil, sayfanın yapısal hazırlığını ölçer ve bu ikisi karıştırıldığında yanlış bir güven duygusu oluşur. Gerçek ölçüm manuel prompt testinden ücretli izleme araçlarına kadar üç ayrı yöntemle yapılabilir, her yöntemin maliyeti ve güvenilirliği farklıdır ve hiçbiri örnekleme ile çıktı değişkenliği sorununu tamamen çözmez. Küçük bir işletme için asıl karar, hangi aracın kullanılacağından önce, ölçüme şu an yatırım yapmanın gerekip gerekmediğidir.
Yapay zeka görünürlüğü tam olarak neyi ölçer?
Yapay zeka görünürlüğü, bir markanın veya sayfanın üretken yapay zeka (generative AI) sistemlerinin cevaplarında ne sıklıkla ve hangi bağlamda geçtiğinin ölçümüdür. Bu, Google’daki organik sıralamadan farklı bir şeydir: sıralama bir sayfanın arama sonuç listesindeki konumunu gösterir, görünürlük ise sayfanın veya markanın bir üretken cevabın içine dahil edilip edilmediğini gösterir. GEO’nun (geo-nedir yazısında tanımlandığı gibi Generative Engine Optimization, üretken arama motorlarında görünürlük çalışması) hedefi tıklama değil, cevabın içinde kaynak veya anılan taraf olarak yer almaktır.
Ölçüm üç ayrı şeye bakar. Anılma, markanın adının cevap metninde geçip geçmediğidir. Atıf, cevabın kaynak olarak belirli bir sayfaya link verip vermediğidir. Konum, marka veya kaynak birden fazla yerde geçiyorsa cevabın neresinde göründüğüdür; ilk cümlede geçen bir isim, üçüncü paragrafa gömülü bir isimden farklı ağırlık taşır. Bu üç gösterge birlikte okunmadan tek bir “görünürlük yüzdesi” rakamı, neyin ölçüldüğünü gizler.
Yapısal hazırlık ölçümü ile gerçek görünürlük ölçümü aynı şey değil
Hayır, aynı şey değildir; biri sayfanın üretken cevaplara girmeye uygunluğunu ölçer, diğeri sayfanın gerçekten o cevaplara girip girmediğini ölçer. Bu ayrımı en açık şekilde kendi aracımız üzerinden göstermek mümkün: içerik yapı ölçümü aracımızın sayfasında şu cümle doğrudan yazılıdır: “Araç gerçek yapay zeka görünürlüğünü tahmin etmez.” Araç yalnızca başlık yapısı, cevap paragrafı, tablo, kaynak işareti ve somut veri gibi dışarıdan ölçülebilen yapısal özellikleri kontrol eder; markanın ChatGPT veya benzer bir üründe fiilen geçip geçmediği ayrı sorgu ve yönlendirme verisiyle ölçülmelidir.
Bu ayrımın önemli olmasının nedeni, Türkçe “AI görünürlüğü nasıl ölçülür” sorgusunda üst sıralarda çıkan rehberlerin bu ayrımı atlamasıdır. Örneğin stradiji.com ve webtures.com’un yayınladığı ölçüm rehberleri “görünürlük yüzdesi”, “pozisyon” gibi göstergeler sıralar ama önerdikleri yöntemin veya bahsettikleri araçların gerçek AI yanıtlarını mı analiz ettiğini yoksa dolaylı bir tahmin mi ürettiğini açıklamaz; ikisi de kendi yönteminin sınırını yazmaz. Bir sayfanın yapısal olarak hazır olması (net başlıklar, cevap-önce paragraf, açık kaynak gösterimi), o sayfanın bir üretken cevaba seçilme olasılığını artırabilir ama seçileceğini garanti etmez. Yapısal hazırlık nedendir, görünürlük sonuçtur; ikisi arasında ölçülmüş, sabit bir dönüşüm oranı yoktur. Bir marka yapısal denetimden tam puan alıp yine de belirli bir sorguda hiç anılmayabilir, çünkü seçim aynı zamanda rakip sayfaların sayısına, konunun rekabet yoğunluğuna ve o an aktif olan modelin davranışına bağlıdır. Üçüncü bir karışıklık kaynağı da ölçüm katmanının kendisidir: marka bir yapay zeka cevabında gerçekten geçse ve okuyucu linke tıklasa bile, tarayıcı referrer bilgisini taşımadan geldiyse bu ziyaret Google Analytics’te “Direct” trafiğe düşer ve hiç gelmemiş gibi görünür; yapay zeka trafiği neden analytics’te görünmüyor yazısı bu ayrı ölçüm boşluğunu GA4’ün kendi kanal tanımlarıyla açıklıyor.
Gerçek görünürlüğü ölçmenin üç yolu
Gerçek yapay zeka görünürlüğü üç yöntemle ölçülür: manuel prompt testi, kendi otomasyonunuz veya ücretli bir izleme aracı; üçü de aynı temel işlemi yapar, aynı soruları tekrar tekrar sorup cevapları kaydeder. Aradaki fark ölçek, maliyet ve tutarlılıktır.
| Yöntem | Nasıl çalışır | Maliyet | Güvenilirlik |
|---|---|---|---|
| Manuel prompt testi | Belirlenen soruları ChatGPT, Perplexity gibi arayüzlere elle sorup cevapları kaydetmek | Yalnızca zaman, araç ücreti yok | Düşük ölçek, yüksek kontrol; birkaç sorguyla eğilim çıkarılmaz |
| Kendi otomasyonu | API üzerinden aynı soru setini programlı olarak, düzenli aralıklarla sormak | Geliştirme zamanı + API kullanım ücreti | Ölçek ve tutarlılık iyi, kurulum ve bakım gerektirir |
| Ücretli izleme aracı | Hazır bir platformun (Semrush AI Visibility Toolkit gibi) çoklu prompt ve çoklu platform taramasını kullanmak | Aylık abonelik | Ölçek yüksek, metodoloji sağlayıcıya bağlı ve genelde tam açıklanmaz |
Üçü de aynı sorunla karşılaşır: bir üretken model aynı soruya her seferinde birebir aynı cevabı vermez, bu davranış aşağıda ayrıca ele alınıyor. Bu yüzden tek bir sorgu tek bir sonuç anlamına gelmez, tekrar sayısı önemlidir.
Ölçüme başlamadan önce sayfanın teknik olarak hazır olup olmadığı ayrıca kontrol edilebilir; site denetimi aracı bu ön koşulu (indeksleme, erişilebilirlik) tarar.
Hangi metrikler izlenir?
Üç metrik ölçülür: anılma oranı, atıf oranı ve cevap içindeki konum; üçü birlikte izlenmezse ölçüm eksik kalır. Anılma oranı, belirlenen sorgu setinin kaçında markanın adının geçtiğini gösterir. Atıf oranı, geçen anılmaların kaçının gerçek bir link veya kaynak gösterimiyle desteklendiğini gösterir; bir marka adının geçmesi ile o markanın sitesine link verilmesi farklı sonuçlardır, çünkü atıf ölçülebilir bir tıklama kaynağı yaratırken salt anılma yalnızca marka bilinirliğine katkı yapar.
Bu iki metriğin birbirinden bağımsız hareket edebileceğine dair somut bir kanıt, ChatGPT’nin kaynak seçimi üzerine yapılmış geniş ölçekli bir araştırmadan geliyor. Ahrefs’in 1,4 milyon ChatGPT promptu üzerinde yaptığı analize göre ChatGPT bir cevap için düzinelerce sayfa getiriyor ama bunların yalnızca yaklaşık yarısını nihai cevapta kaynak olarak gösteriyor; kaynak türüne göre de atıf oranı büyük farklar taşıyor, arama sonucu kökenli sayfalar %88,46 atıf alırken Reddit kökenli sayfalar yalnızca %1,93 atıf alıyor. Bu, “getirilme” ile “atıf alma” arasındaki farkın ne kadar büyük olabileceğini gösteriyor ve tek başına anılma sayısına bakmanın neden yanıltıcı olduğunu somutlaştırıyor.
Üçüncü metrik konum, aynı cevapta birden fazla kaynak varsa hangisinin önce geçtiğidir. Konum ölçümü Türkçe kaynaklarda neredeyse hiç işlenmiyor, oysa bir cevabın ilk cümlesinde geçen kaynak ile son paragrafına sıkışan kaynak aynı “anılma” sayılsa bile okuyucu (ya da sonraki bir sorguyu işleyen model) için eşit ağırlıkta değildir.
Metrik derinliğinin nasıl hesaplandığı, tek bir metriğe (marka anılma oranına) odaklanan ayrı bir yazıda ele alınacaktır.
Ölçümün güvenilirliğini sınırlayan üç şey
Ölçümün güvenilirliğini üç şey sınırlar: örnekleme büyüklüğü, modelin aynı soruya her seferinde farklı cevap verebilmesi ve platformlar arası tutarsızlık. Bunların hiçbiri ölçümü değersiz kılmaz ama sonuçların nasıl okunacağını belirler.
Örnekleme sorunu somut bir örnekle görülebilir. seoClarity’nin Kasım 2025’te ABD’de bir hafta boyunca topladığı 1.000 ChatGPT atfı üzerindeki analizde atıfların yarıdan fazlası tek başına Wikipedia’dan geliyor ve en çok atıf alan ilk 3 URL’nin yarısı Google’ın ilk 100 sıralama sonucunun hiçbirinde görünmüyor. Bu sonuç gerçek ve ölçülmüş ama tek bir haftalık, tek ülkeli bir kesitin sonucudur; başka bir hafta veya başka bir pazarda aynı oranların çıkacağının garantisi yoktur. Bir ölçüm ne kadar çok soru ve ne kadar uzun bir zaman aralığında tekrarlanırsa, o kadar güvenilir hale gelir; tek seferlik bir tarama bir eğilim değil, bir anlık görüntüdür.
İkinci sınır, üretken modellerin aynı soruya her çalıştırmada birebir aynı cevabı üretmeyebilmesidir. Bu davranış modelin yanlış çalıştığı anlamına gelmez, üretken dil modellerinin doğasındandır. Sonuç: bir markanın “bugün göründü, yarın görünmedi” tespiti tek başına bir trend değildir, aynı soru setinin aynı gün içinde birkaç kez tekrarlanması gerekir.
Üçüncü sınır platformlar arasıdır. ChatGPT, Perplexity ve Google AI Overviews farklı kaynak seçim mantıkları kullanır; birinde görünen bir sayfa diğerinde hiç görünmeyebilir. Tek bir platformda yapılan ölçüm, “yapay zeka görünürlüğü” genel bir sonuç gibi sunulamaz; hangi platformda ölçüldüğü açıkça belirtilmelidir.
Search Console’un generative AI performans raporu ne veriyor?
Search Console’daki üretken AI performans raporu, yalnızca Google’ın AI Overviews ve AI Mode gibi kendi özelliklerindeki görünürlüğü gösterir; ChatGPT, Perplexity gibi diğer platformları kapsamaz. Google Search Central, 2026 içinde bu raporu sınırlı sayıda sitede test etmeye başladığını duyurmuştur; erişimi olan bir hesapta URL, gösterim, ülke, cihaz ve tarih kırılımları ayrı ayrı izlenebilir.
Bu rapor ücretsiz ve resmi olduğu için değerlidir ama kapsamı dardır. Bir markanın ChatGPT’de nasıl anıldığı bu raporda görünmez; yalnızca Google’ın kendi üretken yüzeylerindeki davranış izlenebilir. Erişimi olmayan bir hesap için tek alternatif, manuel prompt testi veya yukarıdaki üç yöntemden biridir. Rapora erişim varsa dahi, organik sıralama ile AI görünürlüğü aynı ölçüm değildir; biri yükselirken diğeri sabit kalabilir, ikisi tek bir “SEO performansı” başlığı altında birleştirilmemelidir. Bu rapor genel görünürlüğü değil yalnızca AI Overviews ve AI Mode’u kapsadığı için, o özel yüzeye girmenin kendi koşulları AI Overviews’a nasıl girilir yazısında ayrıca ele alınıyor.
Küçük bir işletme için ölçüme ne zaman yatırım yapılır?
Küçük bir işletme için ücretli bir AI görünürlük aracına yatırım, yalnızca yapısal hazırlık zaten tamamlanmışsa ve marka belirli bir sektör sorgusunda düzenli olarak izlenecek kadar aktif bir müşteri kitlesine sahipse mantıklıdır; aksi halde önce hazırlık, sonra ölçüm sırası izlenmelidir.
| Durum | Önerilen adım | Risk |
|---|---|---|
| Site yeni, yapısal hazırlık henüz test edilmedi | Önce ücretsiz bir yapısal ölçümle hazırlığı doğrula, ücretli görünürlük aracına henüz geçme | Risk: düşük. Erken harcama, henüz ölçülecek bir temel yok |
| Yapısal hazırlık tamam, aylık birkaç manuel prompt testi yeterli | Manuel test yeterli, ücretli araca gerek yok | Risk: düşük. Küçük ölçekte manuel test maliyetsiz ve kontrol edilebilir |
| Marka birden fazla platformda ve haftalık düzenli takip isteniyor | Kendi otomasyonu veya ücretli araç değerlendirilir | Risk: orta. Abonelik maliyeti sonuçların iş kararına dönüşmesine bağlı, aksi halde harcama karşılıksız kalır |
| Bütçe kısıtlı, ekip tek kişi | Ücretli araca yatırım ertelenir, çeyreklik manuel test tercih edilir | Risk: düşük. Düzenli ama seyrek ölçüm, sıfır ölçümden iyidir |
Yapısal hazırlık zaten tamamsa ve ölçüm bütçesi henüz yoksa, sıradaki en verimli adım genellikle ölçüm değil, cevaba seçilme ihtimalini yükselten içerik üretmektir; bu konu yapay zekanın alıntıladığı içerik nasıl yazılır yazısında ele alınıyor.
Ücretli bir aracın sunduğu ölçek, metodolojisi şeffaf değilse tek başına bir güvence değildir. Bir işletme sahibi araç seçmeden önce sağlayıcının kaç prompt kullandığını, hangi platformları taradığını ve ne sıklıkla tazelediğini sormalıdır; GEO araçlarının resmi kaynaklarında bu sınırları ne kadar açık yazdığı araçtan araca büyük fark taşır, bu bilgiler paylaşılmıyorsa ödenen rakam sanılan ölçüde bir kesinlik satın almıyor demektir.
Ücretsiz bir araçla yapay zeka görünürlüğü ölçülür mü?
Hayır, ücretsiz yapısal ölçüm araçları görünürlüğü değil hazırlığı ölçer. Gerçek görünürlük ölçümü için manuel prompt testi ücretsizdir ama zaman gerektirir; otomatikleştirilmiş ölçüm için ya kendi API entegrasyonu ya da ücretli bir araç gerekir.
Güvenilir bir sonuç için kaç prompt yeterli?
Tek bir sabit sayı yoktur; sonuç ne kadar çok soru ve ne kadar uzun süre tekrarlanırsa o kadar güvenilir hale gelir. Ahrefs’in 1,4 milyon promptluk analizi ile seoClarity’nin 1.000 atıflık tek haftalık analizi arasındaki fark, örneklem büyüklüğünün sonucun genellenebilirliğini doğrudan etkilediğini gösterir; küçük bir işletme için birkaç düzine soruyu ayda bir tekrarlamak, tek seferlik bir taramadan daha güvenilir bir eğilim verir.
Aynı soruyu sorduğumda sonuç neden her seferinde değişiyor?
Üretken modeller aynı soruya her çalıştırmada birebir aynı cevabı üretmeyebilir; bu bir hata değil, modelin doğasıdır. Tek bir ölçüm bir trend oluşturmaz; aynı soru setinin birkaç kez tekrarlanması ve sonuçların ortalamasının alınması gerekir.
GEO · AI görünürlüğü · ölçüm · AI Overviews