2014年1月4日 星期六

Rasch analysis for STREAM in measuring change (1/6更新)

最近這一個星期一直在研究Rasch分析如何應用於評估工具前後測資料的驗證,
剛好手邊有幾篇不錯的model paper*可以參考,
所以我就用台大中風住院個案出入院的資料做分析的練習。
*model paper: 


1.         Chang WC, Chan C. Rasch analysis for outcomes measures: some methodological considerations. Arch Phys Med Rehabil 1995; 76: 934-939.
2.         Haley SM, McHorney CA, Ware JE, Jr. Evaluation of the MOS SF-36 physical functioning scale (PF-10): I. Unidimensionality and reproducibility of the Rasch item scale. J Clin Epidemiol 1994; 47: 671-684.
3.         Norquist JM, Fitzpatrick R, Dawson J, Jenkinson C. Comparing alternative Rasch-based methods vs raw scores in measuring change in health. Med Care 2004; 42: I25-36.


我共做了三個評估工具(PASS, PHQ-9, STREAM)的前後測Rasch分析,
結果發現PASS和PHQ-9前後測item calibration的穩定度不佳(項目難度很不類似),
item fitting的狀況也不是很一致。
STREAM前後測Rasch分析的結果還算不錯,
前後測item fitting的情況和項目難度都很類似。
結果如下:
前測(n=394):
Item
Estimate
Weighted fit (Infit)
Unweighted fit (Outfit)
U1
-0.01
1.53
1.80
U2
-0.85
1.13
0.97
U3
-0.07
1.55
1.79
U4
-0.05
0.72
0.50
U5
0.65
0.79
0.64
U6
-0.08
0.84
0.72
U7
-0.36
0.78
0.51
U8
0.01
0.89
0.66
U9
0.15
0.88
0.65
U10
0.62
1.02
0.79
L1
-2.5
1.15
1.35
L2
-1.18
1.04
1.17
L3
-1.19
1.08
1.24
L4
-0.64
0.89
0.93
L5
0.25
1.04
0.72
L6
-1.04
0.77
0.58
L7
0.39
1.03
0.92
L8
1.59
1.28
0.89
L9
1.95
0.87
0.51
L10
2.36
1.08
0.79
M1
-3.36
1.71
2.06
M2
-5.25
1.23
4.60
M3
-1.05
1.73
1.78
M4
-0.56
0.92
0.86
M5
-1.2
0.82
0.59
M6
1.32
0.76
0.50
M7
1.9
0.72
0.46
M8
3.99
0.92
0.50
M9
1.63
0.72
0.45
M10
2.59
0.63
0.39

後測(n=394):
Item
Estimate
Weighted fit (Infit)
Unweighted fit (Outfit)
U1
-0.35
1.21
0.97
U2
-1.11
0.79
0.49
U3
-0.46
1.53
1.76
U4
-0.27
0.83
0.85
U5
0.54
1.00
1.00
U6
0.00
0.85
0.74
U7
-0.10
0.79
0.87
U8
0.35
0.94
1.03
U9
0.58
0.90
0.68
U10
0.83
0.94
1.03
L1
-1.92
0.98
1.20
L2
-1.13
1.12
1.03
L3
-1.00
1.10
1.06
L4
-0.15
0.85
0.68
L5
0.85
1.03
0.97
L6
-0.55
0.76
0.57
L7
1.09
0.94
0.92
L8
-0.09
1.36
1.53
L9
1.64
0.76
0.60
L10
1.24
1.06
0.92
M1
-2.15
1.80
2.22
M2
-4.67
1.36
1.86
M3
-0.36
1.52
2.53
M4
-0.85
0.85
0.64
M5
-1.83
1.07
0.52
M6
1.34
0.84
0.95
M7
1.27
0.74
0.65
M8
3.78
0.97
0.87
M9
1.15
0.74
0.59
M10
2.32
0.73
0.65
註:我用ConQuest作Multidimensional Rasch分析,如果以Infit MNSQ=0.6~1.4這個標準來看,前後測的結果皆顯示U3, M1, M3不符合Rasch model。(前測顯示U1也不符合Rasch model)

參考model paper後,我以ICC分析前後測項目難度的一致性,結果是:0.94 (0.88-0.97),顯示STREAM前後測item calibration的穩定度很高。

當然項目難度於前後測多少也有些變化,可以下圖表示:














圖中的虛線是對角線,代表前後測的項目難度如果相同,就是這一條線。
實線顯示項目難度變化的狀況,
如:虛線下方的項目代表:難度於前測時較簡單,再測時就變難了(logit數值由小變大)。

因為前後測項目難度的一致性高,所以有些學者提出:將前後測分數合併作Rasch分析,找出項目難度的"generalized measure"。這個整合後的項目難度可用來代表評估工具實際應用時的項目難度,畢竟已通過不同時間點測量的考驗。

前後測合併(n=394)


Item
Estimate
Weighted fit (Infit)
Unweighted fit (Outfit)
U1
-0.18
1.38
1.26
U2
-0.96
0.96
0.73
U3
-0.24
1.51
1.68
U4
-0.14
0.80
0.70
U5
0.58
0.93
0.85
U6
-0.05
0.86
0.94
U7
-0.23
0.80
1.58
U8
0.18
0.97
0.92
U9
0.36
0.92
0.81
U10
0.70
1.01
0.93
L1
-2.17
1.05
1.69
L2
-1.11
1.05
1.09
L3
-1.06
1.04
1.03
L4
-0.36
0.84
0.72
L5
0.54
1.02
0.91
L6
-0.78
0.81
0.77
L7
0.73
0.98
1.02
L8
0.77
1.35
1.30
L9
1.75
0.85
0.58
L10
1.69
1.11
0.87
M1
-2.88
1.78
2.33
M2
-4.96
1.40
2.81
M3
-0.73
1.67
1.86
M4
-0.58
0.88
0.75
M5
-1.31
0.84
0.59
M6
1.31
0.85
0.73
M7
1.58
0.73
0.58
M8
3.81
0.95
0.68
M9
1.38
0.74
0.53
M10
2.38
0.67
0.51 

2 則留言:

  1. 不知道是否可以用DIF來檢驗前後測題目的變化?

    回覆刪除
    回覆
    1. DIF檢測可能較適用於工具本身已符合Rasch/IRT model。此時,我們可以檢測"Time DIF",看是否前後測的項目難度有差異,而這樣就不會有項目不符合Rasch/IRT model所產生的其它影響。

      刪除