最近參與的一篇論文獲得了新的審查意見,
Reviewer希望我們可以用Pearson-Filon test比較 Balance CAT和Biodex的再測信度(以Pearson's r表示)。
之前用的比較方式是分別算出二個工具Pearson's r的95% CI,
再看二者是否有重疊,藉以確認二者再測信度是否有顯著差異(沒有重疊就是有顯著差異)。
但Reviewer覺得這個比較方式不夠「正式」,
所以提供我們一個「正式」的統計分析方法:Pearson-Filon test。
Reviewer所提供的論文:
Raghunathan, T. E., Rosebthal, R. & Rubin, D. B. (1996). Comparing correlated but nonoverlapping correlations. Psychological Methods, 1, 178-183.
論文當中,
有Pearson-Filon Z和Raghunathan改良後ZPF的詳細公式。
網路上有人提供Pearson-Filon test SPSS和R的語法,
但其實還是有一點複雜,
所以有好心人設計了自動計算軟體,
只要把評估工具之間二二相關的係數填進去,
就可以把Pearson-Filon Z和ZPF算出來,同時也提供p值,用以確認二個Pearson's r是否有顯著差異。
http://www.quantitativeskills.com/sisa/statistics/Rno.htm
網站中,
A, B是一組相關,
X, Y是另一組相關。
如:A代表Balance CAT的前測,B代表Balance CAT的後測,A, B之間的空格就填Balance CAT前後測的Pearson's r。而X代表Biodex的前測,Y是代表Biodex的後測,X, Y之間的空格就填Biodex前後測的Pearson's r。其它空格就各自填入代表符號之間的Pearson's r。
這個軟體蠻好用的,可以用來比較二個Pearson's r的值,但要注意的是:這二個Pearson's r都是從同一個樣本算出來的喔!
2014年1月15日 星期三
2014年1月13日 星期一
Is there age effect on test-retest agreement of the Attention Scale for Elementary School Children?
「國小兒童注意力量表」論文投稿「特殊教育學刊」所獲得的審查意見中,
有個建議是:探討重複測量之信度問題時,有哪些因素應納入統整考量?不同兒童(一般兒童vs. 臨床兒童)是否會呈現不同的再測穩定性?年齡會不會是影響變因之一?
因為目前的資料皆來自一般兒童,所以無法比較一般兒童與臨床兒童之再測信度。
但年齡的部份有三個不同的年齡族群(二、四和五年級),所以可以比較這三個年齡族群的再測信度。
如果年齡是影響再測信度之變因之一,則三個年級中至少有二個年齡族群的ICC之95% CI不會重疊。
分族群計算ICC之結果如下:
結果發現:三個年級於五個分量表及全量表的ICC值之95% CI皆有重疊,顯示不同年齡族群之再測一致性無顯著差異,即年齡不為影響「國小兒童注意力量表」再測一致性之變因。
然而,由表格中可發現:分配性注意力分量表於二年級和五年級的ICC值之95% CI重疊部分相當少 (僅有0.03),有顯著差異之趨勢。且相較於中高年級之ICC值 (0.71-0.75),低年級之ICC值只有0.33,顯示分配性注意力分量表於低年級使用時之再測一致性較低。另外,交替性注意力分量表於高年級使用之再測一致性也較中低年級低 (ICC=0.37)。雖然本研究之結果顯示國小兒童注意力量表之五個分量表及全量表於三個年齡族群使用時無顯著差異,但因交替性及分配性注意力分量表分別於高年級及低年級有較低之再測一致性,臨床或研究人員使用這二個量表時,仍須謹慎解釋不同年齡層之再測結果。
有個建議是:探討重複測量之信度問題時,有哪些因素應納入統整考量?不同兒童(一般兒童vs. 臨床兒童)是否會呈現不同的再測穩定性?年齡會不會是影響變因之一?
因為目前的資料皆來自一般兒童,所以無法比較一般兒童與臨床兒童之再測信度。
但年齡的部份有三個不同的年齡族群(二、四和五年級),所以可以比較這三個年齡族群的再測信度。
如果年齡是影響再測信度之變因之一,則三個年級中至少有二個年齡族群的ICC之95% CI不會重疊。
分族群計算ICC之結果如下:
結果發現:三個年級於五個分量表及全量表的ICC值之95% CI皆有重疊,顯示不同年齡族群之再測一致性無顯著差異,即年齡不為影響「國小兒童注意力量表」再測一致性之變因。
然而,由表格中可發現:分配性注意力分量表於二年級和五年級的ICC值之95% CI重疊部分相當少 (僅有0.03),有顯著差異之趨勢。且相較於中高年級之ICC值 (0.71-0.75),低年級之ICC值只有0.33,顯示分配性注意力分量表於低年級使用時之再測一致性較低。另外,交替性注意力分量表於高年級使用之再測一致性也較中低年級低 (ICC=0.37)。雖然本研究之結果顯示國小兒童注意力量表之五個分量表及全量表於三個年齡族群使用時無顯著差異,但因交替性及分配性注意力分量表分別於高年級及低年級有較低之再測一致性,臨床或研究人員使用這二個量表時,仍須謹慎解釋不同年齡層之再測結果。
2014年1月9日 星期四
於治療室收案:注意力研究收案新經驗
一開始在亞東收案時,跟那邊借了會議室,
然而因為那是公用的場所,
在借用或使用方面,其實沒那麼方便。
後來陳組長提供二個治療師的座位(位於治療室的左側),
讓我分別於上、下午收案時使用。
本來以為個案會受其它個案做復健的聲音干擾,
但好像也還好耶,
我想注意力評估可能就像平時他們自己做復健一樣,
進行活動時,還是會專注在自己的活動上。
目前亞東收案的模式已經確定了,
那邊的治療師都很友善,也很幫忙,
只是個案多少會因做過太多他人的研究而心生倦意,
且注意力的研究不是以問卷訪談的方式進行,
故個案也會因沒辦法邊做復健邊回答問題而拒絕參加。
目前第一回合的上下午個案共有12個,
跟預期的個案量有點落差,
之後就看夜診的個案量多不多。
雖然收案量不如預期,
但還蠻高興找到新的收案模式,
打破自己既定的想法,
算是一個還不錯的收穫!
然而因為那是公用的場所,
在借用或使用方面,其實沒那麼方便。
後來陳組長提供二個治療師的座位(位於治療室的左側),
讓我分別於上、下午收案時使用。
本來以為個案會受其它個案做復健的聲音干擾,
但好像也還好耶,
我想注意力評估可能就像平時他們自己做復健一樣,
進行活動時,還是會專注在自己的活動上。
目前亞東收案的模式已經確定了,
那邊的治療師都很友善,也很幫忙,
只是個案多少會因做過太多他人的研究而心生倦意,
且注意力的研究不是以問卷訪談的方式進行,
故個案也會因沒辦法邊做復健邊回答問題而拒絕參加。
目前第一回合的上下午個案共有12個,
跟預期的個案量有點落差,
之後就看夜診的個案量多不多。
雖然收案量不如預期,
但還蠻高興找到新的收案模式,
打破自己既定的想法,
算是一個還不錯的收穫!
2014年1月6日 星期一
1/6~1/10任務規畫
|
任務
|
進行時間
|
|
1.
Lynn英文
|
1/6 1:00~2:00pm
|
|
2.
亞東注意力研究:收案/約個案
|
1/7,
8, 9, 10全天
註:為了在過年前讓上下午個案各做一輪,所以這幾天都到亞東收案或約個案
|
|
3.
Rasch分析/結果解讀練習
|
1/6~1/10零星時間
|
|
4.
國小兒童注意力量表論文修改
|
1/6~1/10零星時間
|
2014年1月4日 星期六
Rasch analysis for STREAM in measuring change (1/6更新)
最近這一個星期一直在研究Rasch分析如何應用於評估工具前後測資料的驗證,
剛好手邊有幾篇不錯的model paper*可以參考,
所以我就用台大中風住院個案出入院的資料做分析的練習。
*model paper:
我共做了三個評估工具(PASS, PHQ-9, STREAM)的前後測Rasch分析,
結果發現PASS和PHQ-9前後測item calibration的穩定度不佳(項目難度很不類似),
item fitting的狀況也不是很一致。
STREAM前後測Rasch分析的結果還算不錯,
前後測item fitting的情況和項目難度都很類似。
結果如下:
前測(n=394):
後測(n=394):
註:我用ConQuest作Multidimensional Rasch分析,如果以Infit MNSQ=0.6~1.4這個標準來看,前後測的結果皆顯示U3, M1, M3不符合Rasch model。(前測顯示U1也不符合Rasch model)
參考model paper後,我以ICC分析前後測項目難度的一致性,結果是:0.94 (0.88-0.97),顯示STREAM前後測item calibration的穩定度很高。
當然項目難度於前後測多少也有些變化,可以下圖表示:
圖中的虛線是對角線,代表前後測的項目難度如果相同,就是這一條線。
實線顯示項目難度變化的狀況,
如:虛線下方的項目代表:難度於前測時較簡單,再測時就變難了(logit數值由小變大)。
因為前後測項目難度的一致性高,所以有些學者提出:將前後測分數合併作Rasch分析,找出項目難度的"generalized measure"。這個整合後的項目難度可用來代表評估工具實際應用時的項目難度,畢竟已通過不同時間點測量的考驗。
前後測合併(n=394)
剛好手邊有幾篇不錯的model paper*可以參考,
所以我就用台大中風住院個案出入院的資料做分析的練習。
*model paper:
1. Chang WC, Chan C. Rasch analysis for outcomes measures: some
methodological considerations. Arch Phys Med Rehabil 1995; 76: 934-939.
2. Haley SM, McHorney CA, Ware JE, Jr. Evaluation of the MOS
SF-36 physical functioning scale (PF-10): I. Unidimensionality and
reproducibility of the Rasch item scale. J Clin Epidemiol 1994; 47: 671-684.
3. Norquist JM, Fitzpatrick R, Dawson J, Jenkinson C. Comparing
alternative Rasch-based methods vs raw scores in measuring change in health.
Med Care 2004; 42: I25-36.
我共做了三個評估工具(PASS, PHQ-9, STREAM)的前後測Rasch分析,
結果發現PASS和PHQ-9前後測item calibration的穩定度不佳(項目難度很不類似),
item fitting的狀況也不是很一致。
STREAM前後測Rasch分析的結果還算不錯,
前後測item fitting的情況和項目難度都很類似。
結果如下:
前測(n=394):
Item
|
Estimate
|
Weighted
fit (Infit)
|
Unweighted
fit (Outfit)
|
U1
|
-0.01
|
1.53
|
1.80
|
U2
|
-0.85
|
1.13
|
0.97
|
U3
|
-0.07
|
1.55
|
1.79
|
U4
|
-0.05
|
0.72
|
0.50
|
U5
|
0.65
|
0.79
|
0.64
|
U6
|
-0.08
|
0.84
|
0.72
|
U7
|
-0.36
|
0.78
|
0.51
|
U8
|
0.01
|
0.89
|
0.66
|
U9
|
0.15
|
0.88
|
0.65
|
U10
|
0.62
|
1.02
|
0.79
|
L1
|
-2.5
|
1.15
|
1.35
|
L2
|
-1.18
|
1.04
|
1.17
|
L3
|
-1.19
|
1.08
|
1.24
|
L4
|
-0.64
|
0.89
|
0.93
|
L5
|
0.25
|
1.04
|
0.72
|
L6
|
-1.04
|
0.77
|
0.58
|
L7
|
0.39
|
1.03
|
0.92
|
L8
|
1.59
|
1.28
|
0.89
|
L9
|
1.95
|
0.87
|
0.51
|
L10
|
2.36
|
1.08
|
0.79
|
M1
|
-3.36
|
1.71
|
2.06
|
M2
|
-5.25
|
1.23
|
4.60
|
M3
|
-1.05
|
1.73
|
1.78
|
M4
|
-0.56
|
0.92
|
0.86
|
M5
|
-1.2
|
0.82
|
0.59
|
M6
|
1.32
|
0.76
|
0.50
|
M7
|
1.9
|
0.72
|
0.46
|
M8
|
3.99
|
0.92
|
0.50
|
M9
|
1.63
|
0.72
|
0.45
|
M10
|
2.59
|
0.63
|
0.39
|
後測(n=394):
Item
|
Estimate
|
Weighted
fit (Infit)
|
Unweighted
fit (Outfit)
|
U1
|
-0.35
|
1.21
|
0.97
|
U2
|
-1.11
|
0.79
|
0.49
|
U3
|
-0.46
|
1.53
|
1.76
|
U4
|
-0.27
|
0.83
|
0.85
|
U5
|
0.54
|
1.00
|
1.00
|
U6
|
0.00
|
0.85
|
0.74
|
U7
|
-0.10
|
0.79
|
0.87
|
U8
|
0.35
|
0.94
|
1.03
|
U9
|
0.58
|
0.90
|
0.68
|
U10
|
0.83
|
0.94
|
1.03
|
L1
|
-1.92
|
0.98
|
1.20
|
L2
|
-1.13
|
1.12
|
1.03
|
L3
|
-1.00
|
1.10
|
1.06
|
L4
|
-0.15
|
0.85
|
0.68
|
L5
|
0.85
|
1.03
|
0.97
|
L6
|
-0.55
|
0.76
|
0.57
|
L7
|
1.09
|
0.94
|
0.92
|
L8
|
-0.09
|
1.36
|
1.53
|
L9
|
1.64
|
0.76
|
0.60
|
L10
|
1.24
|
1.06
|
0.92
|
M1
|
-2.15
|
1.80
|
2.22
|
M2
|
-4.67
|
1.36
|
1.86
|
M3
|
-0.36
|
1.52
|
2.53
|
M4
|
-0.85
|
0.85
|
0.64
|
M5
|
-1.83
|
1.07
|
0.52
|
M6
|
1.34
|
0.84
|
0.95
|
M7
|
1.27
|
0.74
|
0.65
|
M8
|
3.78
|
0.97
|
0.87
|
M9
|
1.15
|
0.74
|
0.59
|
M10
|
2.32
|
0.73
|
0.65
|
參考model paper後,我以ICC分析前後測項目難度的一致性,結果是:0.94 (0.88-0.97),顯示STREAM前後測item calibration的穩定度很高。
當然項目難度於前後測多少也有些變化,可以下圖表示:
圖中的虛線是對角線,代表前後測的項目難度如果相同,就是這一條線。
實線顯示項目難度變化的狀況,
如:虛線下方的項目代表:難度於前測時較簡單,再測時就變難了(logit數值由小變大)。
因為前後測項目難度的一致性高,所以有些學者提出:將前後測分數合併作Rasch分析,找出項目難度的"generalized measure"。這個整合後的項目難度可用來代表評估工具實際應用時的項目難度,畢竟已通過不同時間點測量的考驗。
前後測合併(n=394)
Item
|
Estimate
|
Weighted fit (Infit)
|
Unweighted fit (Outfit)
|
U1
|
-0.18
|
1.38
|
1.26
|
U2
|
-0.96
|
0.96
|
0.73
|
U3
|
-0.24
|
1.51
|
1.68
|
U4
|
-0.14
|
0.80
|
0.70
|
U5
|
0.58
|
0.93
|
0.85
|
U6
|
-0.05
|
0.86
|
0.94
|
U7
|
-0.23
|
0.80
|
1.58
|
U8
|
0.18
|
0.97
|
0.92
|
U9
|
0.36
|
0.92
|
0.81
|
U10
|
0.70
|
1.01
|
0.93
|
L1
|
-2.17
|
1.05
|
1.69
|
L2
|
-1.11
|
1.05
|
1.09
|
L3
|
-1.06
|
1.04
|
1.03
|
L4
|
-0.36
|
0.84
|
0.72
|
L5
|
0.54
|
1.02
|
0.91
|
L6
|
-0.78
|
0.81
|
0.77
|
L7
|
0.73
|
0.98
|
1.02
|
L8
|
0.77
|
1.35
|
1.30
|
L9
|
1.75
|
0.85
|
0.58
|
L10
|
1.69
|
1.11
|
0.87
|
M1
|
-2.88
|
1.78
|
2.33
|
M2
|
-4.96
|
1.40
|
2.81
|
M3
|
-0.73
|
1.67
|
1.86
|
M4
|
-0.58
|
0.88
|
0.75
|
M5
|
-1.31
|
0.84
|
0.59
|
M6
|
1.31
|
0.85
|
0.73
|
M7
|
1.58
|
0.73
|
0.58
|
M8
|
3.81
|
0.95
|
0.68
|
M9
|
1.38
|
0.74
|
0.53
|
M10
|
2.38
|
0.67
|
0.51
|
訂閱:
文章 (Atom)

