Psikolojide Ölçme ve Değerlendirme
Psikoloji Bölümü, lisans dersi, 2026-2027 Güz dönemi
Psikolojide Ölçme ve Değerlendirme
Gözlemediğimiz bir özelliği ölçtüğümüzü nereden biliyoruz?
Bu dönem bu soruyla uğraşacağız. Kaygıyı, zekayı, öz-saygıyı kimse doğrudan göremez. Elimizde yalnızca davranışlar, cevaplar ve kayıtlar var. Bunlardan yola çıkıp bir kişiye bir sayı verdiğimizde, o sayının gerçekten bir şeyi gösterdiğini nasıl savunacağız?
Dersi bir konu listesi gibi değil, birbirine bağlı bir hikaye gibi kurdum. Her hafta bir önceki haftanın açık bıraktığı bir sorunu çözmeye çalışacağız. Yapıyı tanımlamakla başlayacağız; birim oluşturmaya, toplam puana, güvenirliğe ve geçerliğe geçeceğiz. Madde tepki kuramından sonra da gizil değişken fikrinin kendisini sorgulayan ağ psikometrisiyle bitireceğiz. Bütün bu yolculuğun altında tek bir fikir var: Psikoloji, ölçmesi ne kadar sağlamsa o kadar bilimdir.
Ölçeklerle sınırlı kalmayacağız. Gözlem, görüşme ve deney kayıtları da aynı soruların muhatabı.
Ders nasıl işleyecek?
Haftada 3 saat yüz yüze buluşacağız. Sınıfımız kalabalık olduğu için R uygulamalarını derste yapmayacağız. Her hafta dersten sonra 20-30 dakikalık bir ekran kaydı, R betiği ve veri dosyası paylaşacağım. Kaydı izleyip betiği kendi bilgisayarınızda ya da bölüm laboratuvarında çalıştırmanızı bekliyorum.
Her dersin ilk 15 dakikasında bir önceki kaydın çıktılarını perdeye yansıtıp birlikte yorumlayacağız. Sınavlarda sizden kod yazmanızı değil, çıktı okumanızı ve yorumlamanızı isteyeceğim.
Dönem boyunca kullanacağımız veriler
Kayıtlarda üç tür veriyle çalışacağız. Birincisi R’daki psych::bfi verisi: yaklaşık 2.800 kişinin 25 Büyük Beşli maddesine verdiği cevaplar, cinsiyet ve eğitim bilgisiyle birlikte. İkincisi simülasyon verileri: gerçek yapısını bildiğimiz için yöntemlerin nerede yanıldığını görebileceğiz. Üçüncüsü sizin verileriniz: grup projelerinde yazdığınız ölçeklerden toplayacağınız cevaplar.
Dönem sonunda neler yapabileceksiniz?
- Bir psikolojik yapıyı kuramsal ve operasyonel olarak tanımlamak; operasyonalizm ile gerçekçi ölçme anlayışını birbirinden ayırmak.
- Gözlem, görüşme, deneysel kayıt ve öz-bildirim yöntemlerini güçlü ve zayıf yanlarıyla karşılaştırmak.
- Ölçeklemenin bir birim oluşturma çabası olduğunu Thurstone, Likert ve Guttman üzerinden açıklamak.
- Klasik test kuramının paralel, tau-eşdeğer ve congeneric modellerini ayırt etmek; duruma uygun güvenirlik katsayısını seçip yorumlamak.
- Madde analizi, faktör analizi ve ölçme değişmezliği çıktılarını okumak.
- Geçerliği tek bir kanıta değil, kanıtlara dayanan bir argüman olarak kurmak.
- Puanları normlara ve ölçütlere göre yorumlamak; Angoff ve Nedelsky yöntemleriyle kesme puanı belirlemenin mantığını açıklamak.
- Madde tepki kuramı modellerini toplam puan sorununa getirilmiş farklı çözümler olarak değerlendirmek.
- Ağ psikometrisinin gizil değişken modellerinden kuramsal olarak nasıl ayrıldığını açıklamak.
- Bir ölçeği geliştirme, uyarlama ya da olduğu gibi kullanma kararını gerekçesiyle vermek.
Hafta hafta
Her haftanın başına o haftanın sorusunu yazdım. R kaydı o haftanın dersinden sonra paylaşılacak.
Ölçmek ne demektir? İşlendi
Ölçmenin tanımı, gizil değişkenler, Borsboom’un yaklaşımı ve Stevens’ın ölçek düzeyleri.
Neyi ölçtüğümüzü nasıl tanımlarız?
Kuramsal ve operasyonel tanım. Operasyonalizm ile gerçekçilik arasındaki gerilim. Nomolojik ağ. Tanımdan yola çıkarak gözlenecek davranışların listesini çıkarmak ve belirtke tablosu hazırlamak.
Davranışı nasıl kayda geçiririz?
Gözlem ve kayıt teknikleri (olay, süre ve zaman örneklemi), görüşme, deneysel kayıtlar ve öz-bildirim. Madde yazımı. Yanıt yanlılıkları: sosyal beğenirlik, onaylama eğilimi, dikkatsiz yanıtlama.
Psikolojik bir özelliğin birimi olabilir mi?
Ölçekleme ve birim sorunu. Thurstone’un karşılaştırmalı yargı yasası, 3. ve 5. haller. İkili karşılaştırmalar ve sıralama yargıları. Likert ve Guttman yaklaşımları.
Maddeleri toplamak ne anlama gelir?
Klasik test kuramı ve X = T + E. Paralel, tau-eşdeğer ve congeneric modeller. Güvenirlik ve ölçmenin standart hatası. Test-tekrar test, paralel form ve iç tutarlılık.
Bu analizler her grup için aynı mı geçerli?
Madde analizi: güçlük, ayırt edicilik, madde-toplam korelasyonu, çeldirici analizi. Klasik test kuramına dayalı madde yanlılığı: Mantel-Haenszel, lojistik regresyon ve arındırma.
Toplamaya hakkımız var mıydı?
Congeneric modelden açımlayıcı faktör analizine. Ortak faktör modeli, paralel analiz, döndürme ve omega katsayısı.
Gizil değişkenin birimini kim belirler, gruplar aynı ölçekte mi?
Doğrulayıcı faktör analizi. Gizil değişkenin biriminin sabitlenmesi ve uyum indeksleri. Çok gruplu doğrulayıcı faktör analiziyle ölçme değişmezliği.
Bir puan neyi ölçtüğünü nasıl kanıtlar?
Geçerlik türlerinden bütünleşik geçerliğe. Messick, Kane ve Standartlar’daki (2014) beş kanıt kaynağı. Ölçüt ve yordama geçerliği için korelasyon, regresyon ve düzeltme formülü. Çok özellik-çok yöntem matrisi. Borsboom’un nedensel geçerlik tanımı.
Bir puan neye göre anlam kazanır?
Genellenebilirlik kuramı: varyans bileşenleri, G ve D çalışmaları. Normlar ve standart puanlar (z, T, yüzdelik, stanin); norm grubunun uygunluğu. Standart belirleme: Angoff ve Nedelsky yöntemleri.
Her madde aynı ağırlığı hak eder mi?
Madde tepki kuramı: toplam puan sorununa model temelli bir çözüm. Rasch modeli ve toplam puanın yeterli istatistik olması. 2PL, 3PL ve 4PL modelleri. Madde karakteristik eğrisi, bilgi fonksiyonu, koşullu standart hata. Thurstone ve Guttman’la bağlantı.
Likert maddeleri ve çok boyutlu yapılar nasıl modellenir?
Dereceli tepki, kısmi puan ve nominal tepki modelleri. Çok boyutlu madde tepki kuramı. Bilgisayar uyarlamalı testlere kısa bir bakış.
Farklı testlerin, grupların ve dillerin puanları karşılaştırılabilir mi?
Test eşitleme ve bağlama. Madde tepki kuramına dayalı madde yanlılığı. Ölçek uyarlama: ITC yönergeleri (2017) ve ekip temelli çeviri. Hazır bir ölçeği kullanmadan önce sorulacak sorular.
Belirtiler ortak bir nedenin işareti mi, bir sistemin parçası mı?
Gizil değişkenin metafiziği ve ağ psikometrisi. Gauss grafik modeli, EBICglasso ve Ising modeli. Merkeziyet ve kararlılık. Açımlayıcı grafik analizi. İki model ailesinin istatistiksel eşdeğerliği.
Dönem projesi
5 kişilik gruplar halinde çalışacaksınız. Her grup bir yapı seçecek, ölçeğini kendisi yazacak, veri toplayacak ve dönem boyunca öğrendiğimiz yöntemleri kendi verisine uygulayacak. Amaç kusursuz bir ölçek üretmek değil. Kendi ölçeğinizin hangi analizden geçip hangisinden kaldığını görmek ve nedenini açıklayabilmek.
Mavi işaretli haftalar teslim haftalarıdır.
- Yapı ve madde havuzu (3. hafta sonu). Kuramsal ve operasyonel tanım, gözlenecek davranışların listesi, belirtke tablosu ve 15-20 maddelik bir havuz. Maddeleri başka bir grup inceleyecek.
- Veri toplama (6. hafta başı). En az 100 katılımcı. Ölçeğinize ek olarak bir grup değişkeni (madde yanlılığı için), en az bir ölçüt değişkeni (geçerlik için) ve bir dikkat kontrol maddesi ekleyeceksiniz. Veri toplamaya başlamadan önce gerekli izinlerle ilgili bilgi verilecek.
- Ara rapor (9. hafta). Madde analizi, güvenirlik, açımlayıcı ve doğrulayıcı faktör analizi, madde yanlılığı.
- Final raporu (14. hafta). Madde tepki kuramı ve ağ analizi, geçerlik argümanı ve şu sorunun cevabı: Ölçeğimiz kullanılmaya hazır mı?
Yeterli veri toplayamayan grup analizlerini psych::bfi verisiyle yapar, kendi maddelerini madde düzeyinde yorumlar.
Değerlendirme
| Bileşen | Ağırlık | Kapsam |
|---|---|---|
| Ara sınav | %25 | 1-7. haftalar. Kavram soruları ve R çıktısı yorumlama. |
| Proje: yapı ve madde havuzu | %5 | Tanım, belirtke tablosu, madde havuzu. |
| Proje: ara rapor | %10 | Klasik test kuramı, faktör analizi, madde yanlılığı. |
| Proje: final raporu | %20 | Madde tepki kuramı, ağ analizi, geçerlik argümanı. |
| Final sınavı | %40 | Bütün dönem. Çıktı yorumlama ve “Bu ölçme iddiası hangi varsayıma dayanıyor, o varsayım yanlışsa ne olur?” türünden sorular. |
Kaynaklar
Ana kitaplar
- Crocker, L. ve Algina, J. (1986). Introduction to classical and modern test theory. Holt, Rinehart and Winston.
- Embretson, S. E. ve Reise, S. P. (2000). Item response theory for psychologists. Erlbaum.
- Erkuş, A. Psikolojide ölçme ve ölçek geliştirme. Pegem Akademi.
- Furr, R. M. (2021). Psychometrics: An introduction (4. baskı). SAGE.
- Isvoranu, A.-M., Epskamp, S., Waldorp, L. J. ve Borsboom, D. (Ed.). (2022). Network psychometrics with R. Routledge.
Başvuru kitapları
- AERA, APA ve NCME. (2014). Standards for educational and psychological testing.
- Borsboom, D. (2005). Measuring the mind. Cambridge University Press.
- Cizek, G. J. ve Bunch, M. B. (2007). Standard setting. SAGE.
- Kolen, M. J. ve Brennan, R. L. (2014). Test equating, scaling, and linking (3. baskı). Springer.
- Shavelson, R. J. ve Webb, N. M. (1991). Generalizability theory: A primer. SAGE.
Makaleler
- Borsboom, D., Mellenbergh, G. J. ve van Heerden, J. (2004). The concept of validity. Psychological Review, 111(4), 1061-1071.
- Campbell, D. T. ve Fiske, D. W. (1959). Convergent and discriminant validation by the multitrait-multimethod matrix. Psychological Bulletin, 56(2), 81-105.
- Cronbach, L. J. ve Meehl, P. E. (1955). Construct validity in psychological tests. Psychological Bulletin, 52(4), 281-302.
- Dang, J., King, K. M. ve Inzlicht, M. (2020). Why are self-report and behavioral measures weakly correlated? Trends in Cognitive Sciences, 24(4), 267-269.
- Flake, J. K. ve Fried, E. I. (2020). Measurement schmeasurement: Questionable measurement practices and how to avoid them. Advances in Methods and Practices in Psychological Science, 3(4), 456-465.
- Golino, H. F. ve Epskamp, S. (2017). Exploratory graph analysis: A new approach for estimating the number of dimensions in psychological research. PLoS ONE, 12(6), e0174035.
- Hedge, C., Powell, G. ve Sumner, P. (2018). The reliability paradox: Why robust cognitive tasks do not produce reliable individual differences. Behavior Research Methods, 50, 1166-1186.
- International Test Commission. (2017). The ITC guidelines for translating and adapting tests (2. baskı).
- Kruis, J. ve Maris, G. (2016). Three representations of the Ising model. Scientific Reports, 6, 34175.
- McNeish, D. (2018). Thanks coefficient alpha, we’ll take it from here. Psychological Methods, 23(3), 412-433.
- McNeish, D. ve Wolf, M. G. (2020). Thinking twice about sum scores. Behavior Research Methods, 52, 2287-2305.
- Messick, S. (1995). Validity of psychological assessment. American Psychologist, 50(9), 741-749.
- Michell, J. (1997). Quantitative science and the definition of measurement in psychology. British Journal of Psychology, 88(3), 355-383.
- Putnick, D. L. ve Bornstein, M. H. (2016). Measurement invariance conventions and reporting: The state of the art and future directions for psychological research. Developmental Review, 41, 71-90.
- Thurstone, L. L. (1927). A law of comparative judgment. Psychological Review, 34(4), 273-286.
Kullanacağımız R paketleri
| Paket | Hafta | Ne için |
|---|---|---|
psych | 2, 5, 6, 7, 10 | Veri hazırlığı, madde analizi, alfa, omega, paralel analiz, açımlayıcı faktör analizi |
irr | 3 | Kappa ve ICC |
BradleyTerry2 | 4 | İkili karşılaştırma modelleri |
difR | 6, 13 | Madde yanlılığı analizleri |
lavaan, semTools | 8, 9 | Doğrulayıcı faktör analizi ve ölçme değişmezliği |
lme4 | 10 | Genellenebilirlik kuramı için varyans bileşenleri |
mirt | 11, 12, 13 | Madde tepki kuramı modelleri |
equate | 13 | Test eşitleme |
bootnet, qgraph, EGAnet | 14 | Ağ tahmini, kararlılık, açımlayıcı grafik analizi |
olcme.org / Son güncelleme: Ekim 2026