顯示具有 教育測驗與評量 標籤的文章。 顯示所有文章
顯示具有 教育測驗與評量 標籤的文章。 顯示所有文章

2015-02-04

常模參照與標準參照


常模參照測驗
標準參照測驗
相同點
1.      均與學習工作的成就領域相關,且均具有甄別學生目的。
2.      皆需明確陳述教學目標作為編製測驗之原則。
3.      均參考應用同一套常見編擬有效試題原則。
4.      盡量控制影響誤差的各種因素。
5.      均使用各種不同測驗類型。
6.      均會重視有利於測驗結果解釋的各種因素。
7.      二者皆重視測驗結果的信度。
量尺準點
中間、事後決定
二端、事前決定
變異性
分數變異性愈大愈好
分數變異性愈小愈好
計分方式
百分等級或標準分數
二分類數字
用途
分班編組(安置性、總結性評量)
補救教學(形成性、診斷性評量)
試題代表性
學習範圍較廣,每一範圍試題較少
(強調試題的鑑別力)
學習範圍較窄,每一範圍試題較多
(強調試題在學生學習工作表現)
測驗計劃性質
使用雙向細目表
使用詳細的教材領域細目表
評量功能
鑑別
檢定
效度考驗
內容效度、建構效度、效標關聯效度
內容效度

難度P與鑑別度D

難度P = 答對人數 / 總人數 (X100)
  • 數值越大 → 越簡單
  • 數值越小 → 越困難

鑑別度D = 高分組答對百分比 / 低分組答對百分比
  • 數值介於 —1.00 到+1.00之間
  • 指數越高 → 鑑別度越佳
  • 指數越低 → 鑑別度越差
  • 指數為0 → 沒有鑑別作用
  • 指數為負 → 錯誤解答或題目不明,試題有反向作用,應淘汰

難度P與鑑別度D的關係
  • 難度P=.50時,鑑別度為+1.00(最大值)
  • 難度太高或太低,鑑別度都下降

效度(Validity)與信度(Reliability)

1. 有效度一定有信度
2. 有信度不一有效度
3. 無信度一定無效度

效度 Validity

外部一致性信度
複本信度
指兩份測驗相同目標的測驗做比較
再測信度
同一張考卷再測驗一次
評分者信度
多個評分者之間的相關
內部一致性信度
折半信度
指一份測驗中前半或後半題目與全部題目做比較
庫李信度
折半到一題對一題來比較
a係數信度
多重計分

內容效度
:測驗內容的代表性
  1. 抽樣效度:量表所包含的項目是否能代表母體構念的項目。內容效度的高低,端賴項目取樣代表性之大小而定。
  2. 表面效度:是指量表項目和形式上,給人的主觀印象,如果該量表從外表來看,似乎確實可適切地測量其欲測的特質或行為,便稱它具有表面效度。
效標關聯效度:分數與外在效標的關連性。又稱實用效度或實証效度,意指這種效度應建立在實証資料之上。
效標:用來顯示測量工具所欲測量或預測的特質之獨立量數,作為檢定效度的參考標準。
  1. 同時效標:是指測量工具與效標同時存在。例如,以「口袋中零用錢」(屬測量工具)衡量受訪者的「所得」(屬效標)高低,假如兩者相關很高,則「同時效度」高。
  2. 預測效標:是指測量工具出現在校標之前。例如,研究者自編「成就測驗」(量表)即可用預測兩年後研究生英文成績當效標,假如兩者相關很高,則表示該量表「預測效標」高。
構念效度:測驗能依據某種理論概念加以解釋的程度。
  1. 收歛效度:指來自相同構念的這些項目,彼此之間相關性高。如若要衡量相同的東西(筆試、口試),則所得分數(結果)應相同(筆試與口試成績之相關要高)
  2. 區別效度:是指來自不同構念的項目,彼此之間相關性低。

信度 Reliability

1. 測驗長度越長,信度越高;反之越低。

2. 測驗內容越多元,信度越低;測量目標越單一,信度越高。


外部一致性信度
複本信度
指兩份測驗相同目標的測驗做比較
再測信度
同一張考卷再測驗一次
評分者信度
多個評分者之間的相關
內部一致性信度
折半信度
指一份測驗中前半或後半題目與全部題目做比較
庫李信度
折半到一題對一題來比較
a係數信度
多重計分




測量誤差

  1. 系統性誤差:它會對測量結果產生一致性固定的影響。
  2. 隨機性誤差:主要是來自受訪者身心狀況(情緒、性格、動機…)、情境因素(噪音、太太在場、趕飛機、太熱…)、及測量試題(內容太長、太難…)的干擾影響。