剛好手邊有幾篇不錯的model paper*可以參考,
所以我就用台大中風住院個案出入院的資料做分析的練習。
*model paper:
1. Chang WC, Chan C. Rasch analysis for outcomes measures: some
methodological considerations. Arch Phys Med Rehabil 1995; 76: 934-939.
2. Haley SM, McHorney CA, Ware JE, Jr. Evaluation of the MOS
SF-36 physical functioning scale (PF-10): I. Unidimensionality and
reproducibility of the Rasch item scale. J Clin Epidemiol 1994; 47: 671-684.
3. Norquist JM, Fitzpatrick R, Dawson J, Jenkinson C. Comparing
alternative Rasch-based methods vs raw scores in measuring change in health.
Med Care 2004; 42: I25-36.
我共做了三個評估工具(PASS, PHQ-9, STREAM)的前後測Rasch分析,
結果發現PASS和PHQ-9前後測item calibration的穩定度不佳(項目難度很不類似),
item fitting的狀況也不是很一致。
STREAM前後測Rasch分析的結果還算不錯,
前後測item fitting的情況和項目難度都很類似。
結果如下:
前測(n=394):
Item
|
Estimate
|
Weighted
fit (Infit)
|
Unweighted
fit (Outfit)
|
U1
|
-0.01
|
1.53
|
1.80
|
U2
|
-0.85
|
1.13
|
0.97
|
U3
|
-0.07
|
1.55
|
1.79
|
U4
|
-0.05
|
0.72
|
0.50
|
U5
|
0.65
|
0.79
|
0.64
|
U6
|
-0.08
|
0.84
|
0.72
|
U7
|
-0.36
|
0.78
|
0.51
|
U8
|
0.01
|
0.89
|
0.66
|
U9
|
0.15
|
0.88
|
0.65
|
U10
|
0.62
|
1.02
|
0.79
|
L1
|
-2.5
|
1.15
|
1.35
|
L2
|
-1.18
|
1.04
|
1.17
|
L3
|
-1.19
|
1.08
|
1.24
|
L4
|
-0.64
|
0.89
|
0.93
|
L5
|
0.25
|
1.04
|
0.72
|
L6
|
-1.04
|
0.77
|
0.58
|
L7
|
0.39
|
1.03
|
0.92
|
L8
|
1.59
|
1.28
|
0.89
|
L9
|
1.95
|
0.87
|
0.51
|
L10
|
2.36
|
1.08
|
0.79
|
M1
|
-3.36
|
1.71
|
2.06
|
M2
|
-5.25
|
1.23
|
4.60
|
M3
|
-1.05
|
1.73
|
1.78
|
M4
|
-0.56
|
0.92
|
0.86
|
M5
|
-1.2
|
0.82
|
0.59
|
M6
|
1.32
|
0.76
|
0.50
|
M7
|
1.9
|
0.72
|
0.46
|
M8
|
3.99
|
0.92
|
0.50
|
M9
|
1.63
|
0.72
|
0.45
|
M10
|
2.59
|
0.63
|
0.39
|
後測(n=394):
Item
|
Estimate
|
Weighted
fit (Infit)
|
Unweighted
fit (Outfit)
|
U1
|
-0.35
|
1.21
|
0.97
|
U2
|
-1.11
|
0.79
|
0.49
|
U3
|
-0.46
|
1.53
|
1.76
|
U4
|
-0.27
|
0.83
|
0.85
|
U5
|
0.54
|
1.00
|
1.00
|
U6
|
0.00
|
0.85
|
0.74
|
U7
|
-0.10
|
0.79
|
0.87
|
U8
|
0.35
|
0.94
|
1.03
|
U9
|
0.58
|
0.90
|
0.68
|
U10
|
0.83
|
0.94
|
1.03
|
L1
|
-1.92
|
0.98
|
1.20
|
L2
|
-1.13
|
1.12
|
1.03
|
L3
|
-1.00
|
1.10
|
1.06
|
L4
|
-0.15
|
0.85
|
0.68
|
L5
|
0.85
|
1.03
|
0.97
|
L6
|
-0.55
|
0.76
|
0.57
|
L7
|
1.09
|
0.94
|
0.92
|
L8
|
-0.09
|
1.36
|
1.53
|
L9
|
1.64
|
0.76
|
0.60
|
L10
|
1.24
|
1.06
|
0.92
|
M1
|
-2.15
|
1.80
|
2.22
|
M2
|
-4.67
|
1.36
|
1.86
|
M3
|
-0.36
|
1.52
|
2.53
|
M4
|
-0.85
|
0.85
|
0.64
|
M5
|
-1.83
|
1.07
|
0.52
|
M6
|
1.34
|
0.84
|
0.95
|
M7
|
1.27
|
0.74
|
0.65
|
M8
|
3.78
|
0.97
|
0.87
|
M9
|
1.15
|
0.74
|
0.59
|
M10
|
2.32
|
0.73
|
0.65
|
參考model paper後,我以ICC分析前後測項目難度的一致性,結果是:0.94 (0.88-0.97),顯示STREAM前後測item calibration的穩定度很高。
當然項目難度於前後測多少也有些變化,可以下圖表示:
圖中的虛線是對角線,代表前後測的項目難度如果相同,就是這一條線。
實線顯示項目難度變化的狀況,
如:虛線下方的項目代表:難度於前測時較簡單,再測時就變難了(logit數值由小變大)。
因為前後測項目難度的一致性高,所以有些學者提出:將前後測分數合併作Rasch分析,找出項目難度的"generalized measure"。這個整合後的項目難度可用來代表評估工具實際應用時的項目難度,畢竟已通過不同時間點測量的考驗。
前後測合併(n=394)
Item
|
Estimate
|
Weighted fit (Infit)
|
Unweighted fit (Outfit)
|
U1
|
-0.18
|
1.38
|
1.26
|
U2
|
-0.96
|
0.96
|
0.73
|
U3
|
-0.24
|
1.51
|
1.68
|
U4
|
-0.14
|
0.80
|
0.70
|
U5
|
0.58
|
0.93
|
0.85
|
U6
|
-0.05
|
0.86
|
0.94
|
U7
|
-0.23
|
0.80
|
1.58
|
U8
|
0.18
|
0.97
|
0.92
|
U9
|
0.36
|
0.92
|
0.81
|
U10
|
0.70
|
1.01
|
0.93
|
L1
|
-2.17
|
1.05
|
1.69
|
L2
|
-1.11
|
1.05
|
1.09
|
L3
|
-1.06
|
1.04
|
1.03
|
L4
|
-0.36
|
0.84
|
0.72
|
L5
|
0.54
|
1.02
|
0.91
|
L6
|
-0.78
|
0.81
|
0.77
|
L7
|
0.73
|
0.98
|
1.02
|
L8
|
0.77
|
1.35
|
1.30
|
L9
|
1.75
|
0.85
|
0.58
|
L10
|
1.69
|
1.11
|
0.87
|
M1
|
-2.88
|
1.78
|
2.33
|
M2
|
-4.96
|
1.40
|
2.81
|
M3
|
-0.73
|
1.67
|
1.86
|
M4
|
-0.58
|
0.88
|
0.75
|
M5
|
-1.31
|
0.84
|
0.59
|
M6
|
1.31
|
0.85
|
0.73
|
M7
|
1.58
|
0.73
|
0.58
|
M8
|
3.81
|
0.95
|
0.68
|
M9
|
1.38
|
0.74
|
0.53
|
M10
|
2.38
|
0.67
|
0.51
|

不知道是否可以用DIF來檢驗前後測題目的變化?
回覆刪除DIF檢測可能較適用於工具本身已符合Rasch/IRT model。此時,我們可以檢測"Time DIF",看是否前後測的項目難度有差異,而這樣就不會有項目不符合Rasch/IRT model所產生的其它影響。
刪除