常模參照測驗
|
標準參照測驗
|
|
相同點
|
1.
均與學習工作的成就領域相關,且均具有甄別學生目的。
2.
皆需明確陳述教學目標作為編製測驗之原則。
3.
均參考應用同一套常見編擬有效試題原則。
4.
盡量控制影響誤差的各種因素。
5.
均使用各種不同測驗類型。
6.
均會重視有利於測驗結果解釋的各種因素。
7.
二者皆重視測驗結果的信度。
|
|
量尺準點
|
中間、事後決定的
|
二端、事前決定的
|
變異性
|
分數變異性愈大愈好
|
分數變異性愈小愈好
|
計分方式
|
百分等級或標準分數
|
二分類數字
|
用途
|
分班編組(安置性、總結性評量)
|
補救教學(形成性、診斷性評量)
|
試題代表性
|
學習範圍較廣,每一範圍試題較少
(強調試題的鑑別力)
|
學習範圍較窄,每一範圍試題較多
(強調試題在學生學習工作表現)
|
測驗計劃性質
|
使用雙向細目表
|
使用詳細的教材領域細目表
|
評量功能
|
鑑別
|
檢定
|
效度考驗
|
內容效度、建構效度、效標關聯效度
|
內容效度
|
2015-02-04
常模參照與標準參照
難度P與鑑別度D
難度P = 答對人數 / 總人數 (X100)
- 數值越大 → 越簡單
- 數值越小 → 越困難
鑑別度D = 高分組答對百分比 / 低分組答對百分比
- 數值介於 —1.00 到+1.00之間
- 指數越高 → 鑑別度越佳
- 指數越低 → 鑑別度越差
- 指數為0 → 沒有鑑別作用
- 指數為負 → 錯誤解答或題目不明,試題有反向作用,應淘汰
難度P與鑑別度D的關係
- 難度P=.50時,鑑別度為+1.00(最大值)
- 難度太高或太低,鑑別度都下降
效度(Validity)與信度(Reliability)
1. 有效度一定有信度
2. 有信度不一有效度
3. 無信度一定無效度
內容效度:測驗內容的代表性
效標:用來顯示測量工具所欲測量或預測的特質之獨立量數,作為檢定效度的參考標準。
2. 有信度不一有效度
3. 無信度一定無效度
效度 Validity
外部一致性信度
|
複本信度
|
指兩份測驗相同目標的測驗做比較
|
再測信度
|
同一張考卷再測驗一次
|
|
評分者信度
|
多個評分者之間的相關
|
|
內部一致性信度
|
折半信度
|
指一份測驗中前半或後半題目與全部題目做比較
|
庫李信度
|
折半到一題對一題來比較
|
|
a係數信度
|
多重計分
|
內容效度:測驗內容的代表性
- 抽樣效度:量表所包含的項目是否能代表母體構念的項目。內容效度的高低,端賴項目取樣代表性之大小而定。
- 表面效度:是指量表項目和形式上,給人的主觀印象,如果該量表從外表來看,似乎確實可適切地測量其欲測的特質或行為,便稱它具有表面效度。
效標:用來顯示測量工具所欲測量或預測的特質之獨立量數,作為檢定效度的參考標準。
- 同時效標:是指測量工具與效標同時存在。例如,以「口袋中零用錢」(屬測量工具)衡量受訪者的「所得」(屬效標)高低,假如兩者相關很高,則「同時效度」高。
- 預測效標:是指測量工具出現在校標之前。例如,研究者自編「成就測驗」(量表)即可用預測兩年後研究生英文成績當效標,假如兩者相關很高,則表示該量表「預測效標」高。
- 收歛效度:指來自相同構念的這些項目,彼此之間相關性高。如若要衡量相同的東西(筆試、口試),則所得分數(結果)應相同(筆試與口試成績之相關要高)
- 區別效度:是指來自不同構念的項目,彼此之間相關性低。
信度 Reliability
1. 測驗長度越長,信度越高;反之越低。
2. 測驗內容越多元,信度越低;測量目標越單一,信度越高。
外部一致性信度
|
複本信度
|
指兩份測驗相同目標的測驗做比較
|
再測信度
|
同一張考卷再測驗一次
|
|
評分者信度
|
多個評分者之間的相關
|
|
內部一致性信度
|
折半信度
|
指一份測驗中前半或後半題目與全部題目做比較
|
庫李信度
|
折半到一題對一題來比較
|
|
a係數信度
|
多重計分
|
測量誤差
- 系統性誤差:它會對測量結果產生一致性固定的影響。
- 隨機性誤差:主要是來自受訪者身心狀況(情緒、性格、動機…)、情境因素(噪音、太太在場、趕飛機、太熱…)、及測量試題(內容太長、太難…)的干擾影響。
訂閱:
文章 (Atom)