Metodoloji
Yorumları nasıl analiz ediyoruz?
Son güncelleme:
Kısaca
Yorum Dedektifi bir ürünün yorumlarını tek tek okumaz; yorum kümesini bir bütün olarak inceler ve dört soruyu yanıtlar: yorumlar birbirinden bağımsız insanlardan mı geliyor gibi görünüyor, ürün hakkında ne kadar bilgi taşıyorlar, puan yorumların anlattığıyla tutarlı mı ve eldeki veri bir sonuca varmaya yeter mi?
Akış her ürün için aynıdır:
- Yorumlar pazar yerinin kendi sayfasından alınır ve ortak bir biçime çevrilir.
- Her yorum için Türkçe metin özellikleri çıkarılır (duygu, konu, özgüllük, deneyim, teşvik izi).
- Yorum kümesi üzerinde sinyaller ölçülür: benzerlik, zaman, puan dağılımı, kalite, son dönem.
- Sinyaller aşağıdaki formüllerle skora dönüşür; her skorun nedeni bulgu olarak yazılır.
Bu sayfa metodolojinin v1.0.0 sürümünü anlatır. Her rapor, hesaplandığı sürümü gösterir; formüller değiştiğinde sürüm numarası da değişir.
Veri
Trendyol yorumları, ürünün herkese açık yorum sayfasının kullandığı kaynaktan alınır. Trendyol şu an sunucumuzun bu kaynağa doğrudan erişmesine izin vermediği için yorumlar, kullanıcının isteğiyle kendi tarayıcısından aktarılır (tarayıcıdan aktarım). Erişim engellerini aşmaya çalışmıyoruz.
- Kapsam: çok yorumlu ürünlerde en yeni 1.500 yorum incelenir. Rapor, incelenen yorum sayısını ve toplamın yüzde kaçı olduğunu gösterir.
- Yıldız dağılımı: pazar yeri, her yıldız için toplam puan ve metinli yorum sayısını veriyorsa yorumsuz puanların etkisi bu tam dağılımdan hesaplanır, örneklemden değil.
- Tutarlılık kontrolü: aktarılan veri; tekrar eden kimlik, geçersiz tarih, beyan edilen yorum sayısını aşma ve tam aktarımda yıldız dağılımının beyanla uyuşması açısından denetlenir. Tutarsız veri reddedilir.
- Örnek analizler kurgusal ürünler ve sentetik yorumlarla üretilir ve her yerde “örnek veri” olarak etiketlenir. Gerçek bir ürün bağlantısına hiçbir zaman sentetik veri döndürülmez.
Türkçe metin işleme
Türkçe eklemeli bir dil ve yorumlar gündelik yazılır. Eşleştirme için her yorum şu adımlardan geçer:
- Türkçe kurallarla küçük harfe çevirme (I → ı, İ → i), ardından yalnızca eşleştirme için ASCII katlama: “çok güzel”, “cok guzel”, “ÇOK GÜZELLL!!!” aynı anahtara iner. Katlanmış metin kullanıcıya gösterilmez.
- Harf tekrarlarını teke indirme (“süperrr” → “süper”), emoji ve bağlantıları ayıklama.
- Yan cümlelere bölme: nokta, virgül ve karşıtlık bağlaçları (“ama”, “fakat”, “ancak”, “yalnız”). Karşıtlıktan sonraki yan cümle duygu hesabında 1,3 kat ağırlık alır.
- Duygu sözlüğü fiil eklerini tanır: “beğendim / beğenmedim”, “çalışıyor / çalışmıyor”, “göremedim”. “Hiçbir sorun yaşamadım”, “problem yok” gibi yapılar olumluya çevrilir; “güzel değil” olumsuzlanır; “çok”, “aşırı”, “kesinlikle” gibi pekiştireçler etkiyi artırır.
- Kök bulma için ilk beş harfle kırpma (F5) kullanılır; Türkçe bilgi erişiminde morfolojik çözümlemeye yakın sonuç verdiği bilinen basit bir yöntemdir.
Metin benzerliği
İki yorumun benzerliği, normalize edilmiş metinlerin 5 karakterlik parçaları üzerinde Jaccard oranıyla ölçülür. Karakter parçaları eklere ve yazım hatalarına dayanıklıdır. Binlerce yorumu hızlı karşılaştırmak için 128 izli MinHash ve 32 × 4 bantlı yerellik duyarlı karma (LSH) kullanılır; aday çiftler kesin Jaccard ile doğrulanır.
| Eşik | Anlamı |
|---|---|
| ≥ 0,60 | Yakın kopya |
| ≥ 0,45 | Benzer (kümeleme için) |
| ≥ 0,30 ve 72 saat içinde | Zamansal olarak yakın benzer (kelime değiştirerek çoğaltılmış şablonları yakalar) |
“Çok güzel, beğendim” gibi kısa kalıpların binlerce kez tekrarlanması doğaldır; bu yüzden yakın kopya kanıtı yalnızca özgül yorumlarda sayılır: en az 8 kelime ve ürüne özgü en az 3 kelime ya da bir ürün konusu içermeli. Aynı cümleyi aylar arayla yazan iki kişi ortak ifade kullanımıyla açıklanabilir; aynı gün yazılan kopya açıklanamaz. Bu yüzden her yakın kopyanın kanıt ağırlığı zamana göre azalır:
| İki yorum arasındaki süre | Ağırlık |
|---|---|
| En az 18 kelimelik metnin ≥ 0,80 benzerlikte kopyası | 1,0 (süreden bağımsız) |
| 3 gün içinde | 1,0 |
| 14 gün içinde | 0,6 |
| 60 gün içinde | 0,3 |
| Daha uzun | 0,12 |
12 kelimeden kısa çiftler ayrıca 0,7 ile, 0,80'in altındaki benzerlikler 0,75 ile çarpılır.
Benzer yorum kümeleri
Benzer çiftler ve birebir kopyalar bir çizge oluşturur; bağlantılı bileşenler kümedir (en az 3 yorum). Zamana yayılmış 40'tan büyük kümeler zincirlenmeye karşı 0,60 eşiğiyle yeniden bölünür. Aynı ifadeyle yazılmış yorumlar farklı şeylere işaret edebileceği için her küme bir tür alır:
- Koordineli görünen: en az 5 yorum, yorumların en az %85'i aynı puan, en az yarısı tek bir 72 saatlik pencerede, ortalama benzerlik küçük kümelerde ≥ 0,42, 10+ yorumda ≥ 0,33.
- Kalıp metin: zamana yayılmış, ortalama benzerliği ≥ 0,55 olan kümeler. Benzerlik ≥ 0,75 ise kopya, daha düşükse ortak dil kullanımı olarak ağırlıklandırılır.
- Ortak şikayet: yorumların en az %70'i 1–3 yıldız ve zamana yayılmış. Bu bir şüphe işareti değildir; birçok kişinin yaşadığı gerçek bir soruna işaret eder.
- Ortak ifade: geri kalan gevşek benzerlikler ve kısa kalıpların tekrarı.
Kümenin şüphe puanı (0–1) = benzerlik etkeni × büyüklük etkeni × (0,4 × aynı puan oranı + 0,35 × zamansal yoğunluk + 0,25 × özgül yorum oranı). Benzerlik etkeni ortalama benzerlik 0,25'ten 0,65'e çıkarken 0'dan 1'e, büyüklük etkeni 2'den 10 yoruma çıkarken 0'dan 1'e yükselir.
Zaman analizi
Yorumlar Türkiye saatine göre günlere yerleştirilir ve 3 günlük kayan pencereler sayılır. Her pencere, çevresindeki ±60 günün medyanına (yerel taban çizgisi) göre Poisson kuyruk testiyle sınanır. Beklenenin en az 3,5 katı olan ve olasılığı on binde birden küçük pencereler “yorum patlaması” sayılır; ardışık pencereler tek döneme birleştirilir.
Hacim artışı tek başına şüpheli değildir. İndirim, kampanya ya da ürünün popülerleşmesi yorum sayısını artırır. Bu yüzden her dönem, dönem dışındaki yorumlarla bileşim açısından karşılaştırılır:
- 5 yıldız oranındaki artış (iki oran z-testi)
- Ortalama yorum uzunluğundaki düşüş
- Kalıp ifade ve kargo yorumu oranındaki artış
- Kopya ya da kümelenmiş yorumların payı
Bileşim değişmiyorsa dönem “organik” sayılır. Türkiye e-ticaret takvimindeki dönemler (Efsane Kasım, yılbaşı, Sevgililer Günü, Anneler ve Babalar Günü, okula dönüş, bayramlar) yorum gecikmesi payıyla tanınır ve bu dönemlerde anomali eşiği yükseltilir.
Teşvik izleri
Türk e-ticaretinde yaygın iki tür teşvik ayrı ağırlıklandırılır:
- Açık karşılık: “5 yıldız karşılığında”, “yorum yapana indirim kodu”, “yorum karşılığında kupon”, “ücretsiz gönderildi”, “iş birliği kapsamında”.
- Dolaylı iz: “yanında hediye göndermişler”, “not yazmışlar”, “kupon kodu”. Satıcının teşekkür notu tek başına zayıf bir işarettir.
“Hediye olarak aldım” gibi masum kullanımlar ve “sponsorluk verseler bu kadar övmem” gibi varsayım cümleleri sayılmaz.
Puan dağılımı
- Yorumsuz puanlar: pazar yerindeki ortalama ile yorum yazanların ortalaması arasındaki fark. Yorumsuz puanlar incelenemez; fark büyükse görünen puan yorumların anlattığından iyimserdir.
- Uç yoğunlaşma: en az 50 yorumda %90+ beş yıldız ve %5'ten az ara puan. Tek başına zayıf bir sinyaldir; gerçek ürünlerde de olur.
- Puan–metin çelişkisi: metni açıkça olumsuz olup 4–5 yıldız verilen ya da tersi yorumlar.
Yorum kalitesi
Her yorum 0–100 arası bir bilgi değeri alır:
| Bileşen | En fazla |
|---|---|
| Uzunluk (60 kelimede doygun, logaritmik) | 35 |
| Ürün konuları (her konu 7 puan) | 20 |
| Ürüne özgü kelimeler | 12 |
| Kullanım deneyimi (“3 aydır kullanıyorum”) | 12 |
| Artı ve eksiyi birlikte anlatma | 8 |
| Ölçü ve sayı (“175 boy, M aldım”) | 6 |
| Karşılaştırma (“önceki modele göre”) | 5 |
| Fotoğraf | 5 |
| Faydalı bulunma | 5 |
Yalnızca kalıp övgüden oluşan yorumlar en fazla 18, yalnızca kargo, paketleme ya da satıcıdan bahsedenler en fazla 12 alır. 50 ve üzeri “detaylı” sayılır. Ürünün Yorum Kalitesi skoru = 0,45 × ortalama bilgi değeri + 0,30 × detaylı yorum oranı + 0,15 × ürünle ilgili yorum oranı + 0,10 × detaylı yorum sayısı (100'de doygun).
Konular ve duygu
Yorumlar ürün kategorisine göre seçilen konu başlıklarında aranır: genel kalite, fiyat/performans, kargo, paketleme, satıcı, iade, orijinallik, hasarlı/eksik ürün, arıza, dayanıklılık, görünüm, boyut, kullanım; giyimde beden, kumaş, rahatlık; elektronikte pil, ses, bağlantı, ekran, performans; kozmetikte koku, cilde etki, etkinlik; gıdada lezzet. Bir konunun duygusu, geçtiği yan cümlenin duygusudur. Kısa ve tek yan cümlelik yorumlarda duygu belirsizse yıldız puanı kullanılır. Kargo, paketleme ve satıcı konuları “ürün dışı” sayılır ve ürün değerlendirmesine karışmaz.
Giyim ürünlerinde beden yorumları “dar/küçük”, “tam” ve “bol/büyük” olarak sayılır; bu yorumların en az yarısı aynı yönü söylüyorsa beden tavsiyesi verilir.
Son dönem
Yorumlar 150 günden uzun bir döneme yayılıyorsa son yoruma göre son 90 gün, değilse en yeni %25 “son dönem” sayılır (her iki dönemde en az 15 yorum). 1–2 yıldız oranları iki oran z-testiyle karşılaştırılır; |z| ≥ 2 ve fark en az 5 puansa değişim anlamlıdır. Bir konu, son dönemdeki olumsuz bahsedilme oranı en az %4 ve önceki dönemin iki katından fazlaysa (en az 4 yorum) “artan şikayet” olarak işaretlenir.
Skorlar
Şüpheli Örüntü Riski (0–100)
Her sinyal 0–1 arası bir güç (g) ve tek başına ulaşabileceği en yüksek katkı (a) taşır. Sinyaller “gürültülü VEYA” ile birleşir: Risk = 100 × (1 − Π(1 − a × g)). Böylece tek bir güçlü sinyal riski belirgin şekilde yükseltebilir, birden fazla orta sinyal birbirini güçlendirir.
| Sinyal | a | g = 1 olduğu nokta |
|---|---|---|
| Benzer yorum kümeleri (Σ büyüklük × şüphe) | 0,85 | yorumların %7'si |
| Küme dışı yakın kopyalar (zaman ağırlıklı) | 0,60 | yorumların %4'ü |
| Yorum patlamaları (anomali × dönem payı) | 0,55 | yorumların %8'i |
| Teşvik izleri | 0,50 | %2 açık ya da %8 dolaylı |
| Tekrarlanan uzun ifadeler (7 günde yoğunlaşan) | 0,35 | yorumların %6'sı |
| Puan dağılımı | 0,30 | bileşik |
| Kalıp ifade yoğunluğu | 0,25 | %80 kalıp ifade |
60 yorumdan az üründe oran temelli sinyaller örneklem güvenilirliğiyle ölçeklenir (çarpan: (n/60)^0,7); açık teşvik izi ve koordineli kümeler ölçeklenmez. Bantlar: 0–19 Düşük, 20–39 Hafif, 40–59 Belirgin, 60–79 Yüksek, 80+ Çok yüksek. Rapordaki ifadenin gücü bu banda bağlıdır.
Veri Güveni (0–100)
Veri güveni = 100 × S × K0,2 × Z0,15 × M0,1 × Y0,1. S yorum sayısı etkenidir (log ölçekte, 500 yorumda doygun: 19 yorum ≈ 0,52, 100 yorum ≈ 0,74). K kapsamadır (incelenen/toplam; en az 800 yorum incelendiyse 1). Z zaman aralığı (120 günde doygun), M metinli yorum oranı, Y kaynak etkenidir (kullanıcı aktarımı 0,8). 75+ Yüksek, 50–74 Orta, 50'nin altı Düşük.
Yorum Güven Skoru (0–100)
Güven = 0,5 × Özgünlük + 0,2 × Kalite + 0,2 × Temsil gücü + 0,1 × Yayılım
- Özgünlük = 100 − Şüpheli Örüntü Riski
- Kalite = Yorum Kalitesi skoru
- Temsil gücü = 100 − (60 × kargo/satıcı yorumu oranı) − (yorumsuz puan farkı 0,15'i aşarsa fark × 60, en fazla 25) − (son dönemde kötüleşme: 10 + 60 × olumsuz oran artışı, en fazla 35) − (iyileşme: 5) − (çelişki oranı × 100, en fazla 15) − (uç yoğunlaşma: 10)
- Yayılım = 100 × (0,6 + 0,4 × zaman aralığı/180 gün) × (1 − 0,6 × şüpheli patlama payı) × (0,7 + 0,3 × tekil metin oranı)
Veri az olduğunda yüksek skor verilmez: skor en fazla 40 + 0,6 × veri güveni olabilir. Şüpheli örüntü riski 70 ve üzerindeyse skor en fazla 40'tır. Bantlar: 80+ Güvenilir görünüyor, 65–79 Büyük ölçüde güvenilir, 50–64 Dikkatli okuyun, 35–49 Belirgin şüpheli örüntüler, 35'in altı Yorumlar güvenilir görünmüyor.
Puan gerçeklik kontrolü
Raporda aynı ölçek üzerinde birkaç ortalama gösterilir:
- Pazar yerinde görünen ortalama (yorumsuz puanlar dahil)
- İncelenen yorumların ortalaması
- Filtrelenmiş ortalama: şüphe puanı 0,4 ve üzerindeki kümelerdeki yorumlar, açık teşvik izi taşıyanlar ve şüpheli patlamalardaki kalıp/kargo yorumları çıkarılır; kalan yorumlar (0,5 + bilgi değeri/100) ile ağırlıklandırılır. En az 30 yorum kalmalıdır.
- Detaylı yorumların ortalaması (en az 15 detaylı yorum)
- Son dönem ortalaması
Son dönem görünen puandan 0,25 puan düşükse ve kötüleşme anlamlıysa puan “son dönemi yansıtmıyor”; görünen puan filtrelenmiş ortalamadan 0,3 puan yüksekse “iyimser” sayılır.
Yapay zekânın rolü
Skorlar, sayılar ve bulgular yapay zekâ tarafından üretilmez; bu sayfadaki kurallarla hesaplanır. Raporlardaki metinler de hesaplanan değerlerden şablonla yazılır. İleride özetleri daha akıcı hâle getirmek için dil modeli kullanırsak modele yalnızca hesaplanmış bulgular verilecek ve modelin yazdığı her sayı bulgularla karşılaştırılarak doğrulanacak; yorum metinleri modele talimat olarak değil, veri olarak iletilecek.
Sınırlar
- Tek bir yorumun sahte olduğunu kanıtlayamayız; ölçtüğümüz şey yorum kümesindeki örüntülerdir.
- Zamana yayılmış, doğal dille yazılmış tek tük yönlendirilmiş yorumlar ayırt edilemeyebilir.
- Pazar yerinin kaldırdığı yorumları ve yorumsuz puanların içeriğini göremeyiz.
- Duygu ve konu çıkarımı sözlük tabanlıdır; ironi ve alışılmadık yazımda yanılabilir.
- Çok yorumlu ürünlerde en yeni 1.500 yorum incelenir; eski dönemler rapora dahil olmayabilir.
Bir analizde hata olduğunu düşünüyorsanız bize yazın. Satıcıların itirazlarını inceliyor, olgusal hataları düzeltiyoruz.