Psikolojide Ölçme ve Değerlendirme

Psikolojide Ölçme ve Değerlendirme | Ders İzlencesi

Psikoloji Bölümü, lisans dersi, 2026-2027 Güz dönemi

Psikolojide Ölçme ve Değerlendirme

Gözlemediğimiz bir özelliği ölçtüğümüzü nereden biliyoruz?

Bu dönem bu soruyla uğraşacağız. Kaygıyı, zekayı, öz-saygıyı kimse doğrudan göremez. Elimizde yalnızca davranışlar, cevaplar ve kayıtlar var. Bunlardan yola çıkıp bir kişiye bir sayı verdiğimizde, o sayının gerçekten bir şeyi gösterdiğini nasıl savunacağız?

Dersi bir konu listesi gibi değil, birbirine bağlı bir hikaye gibi kurdum. Her hafta bir önceki haftanın açık bıraktığı bir sorunu çözmeye çalışacağız. Yapıyı tanımlamakla başlayacağız; birim oluşturmaya, toplam puana, güvenirliğe ve geçerliğe geçeceğiz. Madde tepki kuramından sonra da gizil değişken fikrinin kendisini sorgulayan ağ psikometrisiyle bitireceğiz. Bütün bu yolculuğun altında tek bir fikir var: Psikoloji, ölçmesi ne kadar sağlamsa o kadar bilimdir.

Ölçeklerle sınırlı kalmayacağız. Gözlem, görüşme ve deney kayıtları da aynı soruların muhatabı.

Ders nasıl işleyecek?

Haftada 3 saat yüz yüze buluşacağız. Sınıfımız kalabalık olduğu için R uygulamalarını derste yapmayacağız. Her hafta dersten sonra 20-30 dakikalık bir ekran kaydı, R betiği ve veri dosyası paylaşacağım. Kaydı izleyip betiği kendi bilgisayarınızda ya da bölüm laboratuvarında çalıştırmanızı bekliyorum.

Her dersin ilk 15 dakikasında bir önceki kaydın çıktılarını perdeye yansıtıp birlikte yorumlayacağız. Sınavlarda sizden kod yazmanızı değil, çıktı okumanızı ve yorumlamanızı isteyeceğim.

Dönem boyunca kullanacağımız veriler

Kayıtlarda üç tür veriyle çalışacağız. Birincisi R’daki psych::bfi verisi: yaklaşık 2.800 kişinin 25 Büyük Beşli maddesine verdiği cevaplar, cinsiyet ve eğitim bilgisiyle birlikte. İkincisi simülasyon verileri: gerçek yapısını bildiğimiz için yöntemlerin nerede yanıldığını görebileceğiz. Üçüncüsü sizin verileriniz: grup projelerinde yazdığınız ölçeklerden toplayacağınız cevaplar.

Dönem sonunda neler yapabileceksiniz?

  1. Bir psikolojik yapıyı kuramsal ve operasyonel olarak tanımlamak; operasyonalizm ile gerçekçi ölçme anlayışını birbirinden ayırmak.
  2. Gözlem, görüşme, deneysel kayıt ve öz-bildirim yöntemlerini güçlü ve zayıf yanlarıyla karşılaştırmak.
  3. Ölçeklemenin bir birim oluşturma çabası olduğunu Thurstone, Likert ve Guttman üzerinden açıklamak.
  4. Klasik test kuramının paralel, tau-eşdeğer ve congeneric modellerini ayırt etmek; duruma uygun güvenirlik katsayısını seçip yorumlamak.
  5. Madde analizi, faktör analizi ve ölçme değişmezliği çıktılarını okumak.
  6. Geçerliği tek bir kanıta değil, kanıtlara dayanan bir argüman olarak kurmak.
  7. Puanları normlara ve ölçütlere göre yorumlamak; Angoff ve Nedelsky yöntemleriyle kesme puanı belirlemenin mantığını açıklamak.
  8. Madde tepki kuramı modellerini toplam puan sorununa getirilmiş farklı çözümler olarak değerlendirmek.
  9. Ağ psikometrisinin gizil değişken modellerinden kuramsal olarak nasıl ayrıldığını açıklamak.
  10. Bir ölçeği geliştirme, uyarlama ya da olduğu gibi kullanma kararını gerekçesiyle vermek.

Hafta hafta

Her haftanın başına o haftanın sorusunu yazdım. R kaydı o haftanın dersinden sonra paylaşılacak.

1

Ölçmek ne demektir? İşlendi

Ölçmenin tanımı, gizil değişkenler, Borsboom’un yaklaşımı ve Stevens’ın ölçek düzeyleri.

R kaydıR ve RStudio kurulumu, veri yapıları.
OkumaBorsboom (2005), 1. bölüm; Michell (1997).
2

Neyi ölçtüğümüzü nasıl tanımlarız?

Kuramsal ve operasyonel tanım. Operasyonalizm ile gerçekçilik arasındaki gerilim. Nomolojik ağ. Tanımdan yola çıkarak gözlenecek davranışların listesini çıkarmak ve belirtke tablosu hazırlamak.

R kaydıVeri girişi, kodlama, ters maddelerin çevrilmesi.
OkumaCronbach ve Meehl (1955); Flake ve Fried (2020).
3

Davranışı nasıl kayda geçiririz?

Gözlem ve kayıt teknikleri (olay, süre ve zaman örneklemi), görüşme, deneysel kayıtlar ve öz-bildirim. Madde yazımı. Yanıt yanlılıkları: sosyal beğenirlik, onaylama eğilimi, dikkatsiz yanıtlama.

R kaydıGözlemciler arası uyum (kappa ve ICC); dikkatsiz yanıtlayanları bulmak.
OkumaHedge, Powell ve Sumner (2018); Dang, King ve Inzlicht (2020).
4

Psikolojik bir özelliğin birimi olabilir mi?

Ölçekleme ve birim sorunu. Thurstone’un karşılaştırmalı yargı yasası, 3. ve 5. haller. İkili karşılaştırmalar ve sıralama yargıları. Likert ve Guttman yaklaşımları.

R kaydıİkili karşılaştırma verisinden 5. hal ölçek değerleri; Bradley-Terry modeli; Guttman yeniden üretilebilirlik katsayısı.
OkumaThurstone (1927); Crocker ve Algina, ölçekleme bölümü.
5

Maddeleri toplamak ne anlama gelir?

Klasik test kuramı ve X = T + E. Paralel, tau-eşdeğer ve congeneric modeller. Güvenirlik ve ölçmenin standart hatası. Test-tekrar test, paralel form ve iç tutarlılık.

R kaydıÜç modelden veri üretip alfanın nasıl davrandığını izlemek.
OkumaFurr, klasik test kuramı bölümleri; McNeish (2018).
6

Bu analizler her grup için aynı mı geçerli?

Madde analizi: güçlük, ayırt edicilik, madde-toplam korelasyonu, çeldirici analizi. Klasik test kuramına dayalı madde yanlılığı: Mantel-Haenszel, lojistik regresyon ve arındırma.

R kaydıMadde istatistikleri; cinsiyete göre Mantel-Haenszel ve lojistik regresyon DIF analizi.
OkumaCrocker ve Algina, madde analizi ve yanlılık bölümleri.
7

Toplamaya hakkımız var mıydı?

Congeneric modelden açımlayıcı faktör analizine. Ortak faktör modeli, paralel analiz, döndürme ve omega katsayısı.

R kaydıParalel analiz, açımlayıcı faktör analizi, omega; çok boyutlu bir veride alfanın neden yine yüksek çıkabildiği.
OkumaMcNeish ve Wolf (2020).
8

Gizil değişkenin birimini kim belirler, gruplar aynı ölçekte mi?

Doğrulayıcı faktör analizi. Gizil değişkenin biriminin sabitlenmesi ve uyum indeksleri. Çok gruplu doğrulayıcı faktör analiziyle ölçme değişmezliği.

R kaydıDoğrulayıcı faktör analizi; yapısal, metrik ve skaler değişmezlik testleri.
OkumaPutnick ve Bornstein (2016).
9

Bir puan neyi ölçtüğünü nasıl kanıtlar?

Geçerlik türlerinden bütünleşik geçerliğe. Messick, Kane ve Standartlar’daki (2014) beş kanıt kaynağı. Ölçüt ve yordama geçerliği için korelasyon, regresyon ve düzeltme formülü. Çok özellik-çok yöntem matrisi. Borsboom’un nedensel geçerlik tanımı.

R kaydıÖlçüte dayalı regresyon, düzeltme formülü, çok özellik-çok yöntem matrisi.
OkumaMessick (1995); Campbell ve Fiske (1959); Borsboom, Mellenbergh ve van Heerden (2004).
10

Bir puan neye göre anlam kazanır?

Genellenebilirlik kuramı: varyans bileşenleri, G ve D çalışmaları. Normlar ve standart puanlar (z, T, yüzdelik, stanin); norm grubunun uygunluğu. Standart belirleme: Angoff ve Nedelsky yöntemleri.

R kaydıVaryans bileşenleri; norm tablosu hazırlama; Angoff ve Nedelsky hesaplamaları.
OkumaShavelson ve Webb (1991); Cizek ve Bunch (2007).
11

Her madde aynı ağırlığı hak eder mi?

Madde tepki kuramı: toplam puan sorununa model temelli bir çözüm. Rasch modeli ve toplam puanın yeterli istatistik olması. 2PL, 3PL ve 4PL modelleri. Madde karakteristik eğrisi, bilgi fonksiyonu, koşullu standart hata. Thurstone ve Guttman’la bağlantı.

R kaydıRasch’tan 4PL’ye modelleri karşılaştırmak; bilgi eğrileri.
OkumaEmbretson ve Reise (2000).
12

Likert maddeleri ve çok boyutlu yapılar nasıl modellenir?

Dereceli tepki, kısmi puan ve nominal tepki modelleri. Çok boyutlu madde tepki kuramı. Bilgisayar uyarlamalı testlere kısa bir bakış.

R kaydıDereceli tepki modeli, nominal model, çok boyutlu model.
OkumaEmbretson ve Reise (2000).
13

Farklı testlerin, grupların ve dillerin puanları karşılaştırılabilir mi?

Test eşitleme ve bağlama. Madde tepki kuramına dayalı madde yanlılığı. Ölçek uyarlama: ITC yönergeleri (2017) ve ekip temelli çeviri. Hazır bir ölçeği kullanmadan önce sorulacak sorular.

R kaydıDoğrusal ve eşit yüzdelikli eşitleme; madde tepki kuramına dayalı DIF.
OkumaITC (2017); Kolen ve Brennan (2014).
14

Belirtiler ortak bir nedenin işareti mi, bir sistemin parçası mı?

Gizil değişkenin metafiziği ve ağ psikometrisi. Gauss grafik modeli, EBICglasso ve Ising modeli. Merkeziyet ve kararlılık. Açımlayıcı grafik analizi. İki model ailesinin istatistiksel eşdeğerliği.

R kaydıAğ tahmini, kararlılık analizi, açımlayıcı grafik analizi.
OkumaIsvoranu ve ark. (2022); Kruis ve Maris (2016).

Dönem projesi

5 kişilik gruplar halinde çalışacaksınız. Her grup bir yapı seçecek, ölçeğini kendisi yazacak, veri toplayacak ve dönem boyunca öğrendiğimiz yöntemleri kendi verisine uygulayacak. Amaç kusursuz bir ölçek üretmek değil. Kendi ölçeğinizin hangi analizden geçip hangisinden kaldığını görmek ve nedenini açıklayabilmek.

Mavi işaretli haftalar teslim haftalarıdır.

  1. Yapı ve madde havuzu (3. hafta sonu). Kuramsal ve operasyonel tanım, gözlenecek davranışların listesi, belirtke tablosu ve 15-20 maddelik bir havuz. Maddeleri başka bir grup inceleyecek.
  2. Veri toplama (6. hafta başı). En az 100 katılımcı. Ölçeğinize ek olarak bir grup değişkeni (madde yanlılığı için), en az bir ölçüt değişkeni (geçerlik için) ve bir dikkat kontrol maddesi ekleyeceksiniz. Veri toplamaya başlamadan önce gerekli izinlerle ilgili bilgi verilecek.
  3. Ara rapor (9. hafta). Madde analizi, güvenirlik, açımlayıcı ve doğrulayıcı faktör analizi, madde yanlılığı.
  4. Final raporu (14. hafta). Madde tepki kuramı ve ağ analizi, geçerlik argümanı ve şu sorunun cevabı: Ölçeğimiz kullanılmaya hazır mı?

Yeterli veri toplayamayan grup analizlerini psych::bfi verisiyle yapar, kendi maddelerini madde düzeyinde yorumlar.

Değerlendirme

BileşenAğırlıkKapsam
Ara sınav%251-7. haftalar. Kavram soruları ve R çıktısı yorumlama.
Proje: yapı ve madde havuzu%5Tanım, belirtke tablosu, madde havuzu.
Proje: ara rapor%10Klasik test kuramı, faktör analizi, madde yanlılığı.
Proje: final raporu%20Madde tepki kuramı, ağ analizi, geçerlik argümanı.
Final sınavı%40Bütün dönem. Çıktı yorumlama ve “Bu ölçme iddiası hangi varsayıma dayanıyor, o varsayım yanlışsa ne olur?” türünden sorular.

Kaynaklar

Ana kitaplar

  • Crocker, L. ve Algina, J. (1986). Introduction to classical and modern test theory. Holt, Rinehart and Winston.
  • Embretson, S. E. ve Reise, S. P. (2000). Item response theory for psychologists. Erlbaum.
  • Erkuş, A. Psikolojide ölçme ve ölçek geliştirme. Pegem Akademi.
  • Furr, R. M. (2021). Psychometrics: An introduction (4. baskı). SAGE.
  • Isvoranu, A.-M., Epskamp, S., Waldorp, L. J. ve Borsboom, D. (Ed.). (2022). Network psychometrics with R. Routledge.

Başvuru kitapları

  • AERA, APA ve NCME. (2014). Standards for educational and psychological testing.
  • Borsboom, D. (2005). Measuring the mind. Cambridge University Press.
  • Cizek, G. J. ve Bunch, M. B. (2007). Standard setting. SAGE.
  • Kolen, M. J. ve Brennan, R. L. (2014). Test equating, scaling, and linking (3. baskı). Springer.
  • Shavelson, R. J. ve Webb, N. M. (1991). Generalizability theory: A primer. SAGE.

Makaleler

  • Borsboom, D., Mellenbergh, G. J. ve van Heerden, J. (2004). The concept of validity. Psychological Review, 111(4), 1061-1071.
  • Campbell, D. T. ve Fiske, D. W. (1959). Convergent and discriminant validation by the multitrait-multimethod matrix. Psychological Bulletin, 56(2), 81-105.
  • Cronbach, L. J. ve Meehl, P. E. (1955). Construct validity in psychological tests. Psychological Bulletin, 52(4), 281-302.
  • Dang, J., King, K. M. ve Inzlicht, M. (2020). Why are self-report and behavioral measures weakly correlated? Trends in Cognitive Sciences, 24(4), 267-269.
  • Flake, J. K. ve Fried, E. I. (2020). Measurement schmeasurement: Questionable measurement practices and how to avoid them. Advances in Methods and Practices in Psychological Science, 3(4), 456-465.
  • Golino, H. F. ve Epskamp, S. (2017). Exploratory graph analysis: A new approach for estimating the number of dimensions in psychological research. PLoS ONE, 12(6), e0174035.
  • Hedge, C., Powell, G. ve Sumner, P. (2018). The reliability paradox: Why robust cognitive tasks do not produce reliable individual differences. Behavior Research Methods, 50, 1166-1186.
  • International Test Commission. (2017). The ITC guidelines for translating and adapting tests (2. baskı).
  • Kruis, J. ve Maris, G. (2016). Three representations of the Ising model. Scientific Reports, 6, 34175.
  • McNeish, D. (2018). Thanks coefficient alpha, we’ll take it from here. Psychological Methods, 23(3), 412-433.
  • McNeish, D. ve Wolf, M. G. (2020). Thinking twice about sum scores. Behavior Research Methods, 52, 2287-2305.
  • Messick, S. (1995). Validity of psychological assessment. American Psychologist, 50(9), 741-749.
  • Michell, J. (1997). Quantitative science and the definition of measurement in psychology. British Journal of Psychology, 88(3), 355-383.
  • Putnick, D. L. ve Bornstein, M. H. (2016). Measurement invariance conventions and reporting: The state of the art and future directions for psychological research. Developmental Review, 41, 71-90.
  • Thurstone, L. L. (1927). A law of comparative judgment. Psychological Review, 34(4), 273-286.

Kullanacağımız R paketleri

PaketHaftaNe için
psych2, 5, 6, 7, 10Veri hazırlığı, madde analizi, alfa, omega, paralel analiz, açımlayıcı faktör analizi
irr3Kappa ve ICC
BradleyTerry24İkili karşılaştırma modelleri
difR6, 13Madde yanlılığı analizleri
lavaan, semTools8, 9Doğrulayıcı faktör analizi ve ölçme değişmezliği
lme410Genellenebilirlik kuramı için varyans bileşenleri
mirt11, 12, 13Madde tepki kuramı modelleri
equate13Test eşitleme
bootnet, qgraph, EGAnet14Ağ tahmini, kararlılık, açımlayıcı grafik analizi

olcme.org  /  Son güncelleme: Ekim 2026

Similar Posts

Leave a Reply

Your email address will not be published. Required fields are marked *