报告概述
本报告旨在评估CRASE5自动评分引擎在ACT写作测试中的表现。CRASE5是CRASE系列的最新一代,新增了离题检测、令人不安内容检测等预评分功能。报告基于约14,000篇论文的训练和5,128篇盲验证样本,从分布一致性、评分者间协议(精确匹配率、二次加权Kappa)及子组公平性(按性别、种族、西班牙裔身份)等维度,系统比较了CRASE5与人工评分员的评分结果,并分别分析了1-6和2-12两种量表的适用性。报告还详细说明了CRASE5自动检测空响应、非英文、离题、难以辨认、踢出、令人不安内容等条件代码的流程。该报告为教育测评从业者提供了自动评分引擎效度的关键证据。
报告的核心结论
CRASE5评分与人工评分高度一致,符合行业标准
在四个写作领域(观点与分析、发展与风格、组织、语言使用和规范)的1-6量表上,R1-CRASE5精确匹配率均超过71%,二次加权Kappa均达0.82以上,超过ACT要求的60%精确匹配率和0.70 QWK阈值。与CRASE+模型相比,CRASE5在多数指标上持平或略有提升。
CRASE5对不同考生群体评分公平,无明显偏差
按性别、西班牙裔身份、种族/民族进行的子组分析显示,在1-6量表中仅有极少数指标(如领域2中多种族群体的SMD为0.14)略超阈值,整体未发现系统性的评分差异,表明CRASE5能公平应用于不同人口学特征的考生。
CRASE5新增的预评分功能有效保障评分质量
CRASE5集成了自动检测空响应、非英文、离题、难以辨认、踢出(短响应或高比例大写)及令人不安内容等条件代码的模型。这些预评分检查能提前识别无效或异常回答,确保仅有效论文进入通用评分模型,从而提升整体评分的可靠性和安全性。
报告回答的关键问题
CRASE5自动评分引擎的评分准确吗?
准确。在盲验证样本中,CRASE5与人工评分员在1-6量表上的精确匹配率超过71%,二次加权Kappa超过0.82,均满足或优于行业标准。在2-12量表上,精确匹配率约54%-58%,QWK达0.88-0.91,表明评分与人工记录高度一致。
CRASE5对不同性别、种族的考生存在评分偏差吗?
子组分析表明,CRASE5的评分偏差极小。在1-6量表上,仅发现两处指标略超阈值(如领域2中多种族群体的SMD为0.14),其余所有性别、西班牙裔身份、种族子组的各项指标均在预设可接受范围内,证明引擎对不同群体公平。
CRASE5新增了哪些自动检测功能?
CRASE5新增了离题检测(使用神经网络编码器比较提示与回复语义相似度,阈值0.6)、令人不安内容检测(调整后的神经网络语言模型)、不可读性检查(数字/符号仅,三字母组合分析)。同时保留了空响应、非英文、踢出(字数<25或大写>20%)等原有检测,形成完整的预评分流程。
报告中的代表性数据
1-6量表观点与分析领域R1-CRASE5精确匹配率
盲验证样本,在领域1(观点与分析)盲验证样本中,CRASE5与人工评分员1的精确一致率为71.1%,超过ACT最低阈值60%,也高于人工评分员间的一致率68.0%。
1-6量表观点与分析领域R1-CRASE5二次加权Kappa
盲验证样本,同一领域R1-CRASE5的QWK为0.85,超过行业推荐标准0.70,且略高于人工评分员间的0.83。
2-12量表观点与分析领域记录-CRASE5二次加权Kappa
盲验证样本,在2-12量表上,记录分数与CRASE5分数的QWK为0.91,远高于0.70阈值,表明引擎在更精细量表上也能保持极高一致性。
以上数据根据报告摘要整理,具体统计口径和数值请以完整报告原文为准。
完整报告包含什么
- 训练与验证数据详情:包括2020-2021年ACT国际、州和地区考试中约14,000篇论文的来源、排除条件码的标准,以及训练和盲验证样本的提示分配、考生性别、西班牙裔身份、种族/民族分布表。
- CRASE5引擎训练方法:详细描述39个写作特征的提取、梯度提升回归模型的拟合过程,以及将连续预测值离散化为1-6和2-12量表的规则(基于训练样本中评分员1得分分布)。
- 四个写作领域(观点与分析、发展与风格、组织、语言使用和规范)的完整分布性指标和一致性指标表格(表1a-4b),包含各得分点百分比、均值、标准差、SMD、Kappa、QWK等。
- 按11个具体写作提示的R1-CRASE5协议度量(表5a-5k),识别了少数未达阈值的提示,并说明ACT将对这些提示采用双人工评分以保证质量。
- 子组分析全套ETS风格表格(表10-17):分别按性别、西班牙裔身份、种族/民族展示1-6和2-12量表下的SMD、精确一致率、QWK、相关系数等,并标注超出阈值的指标。
- 条件码自动检测预评分流程的完整描述:包括空响应、非英文、离题(语义相似度阈值0.6和直接复制检测余弦相似度0.9)、难以辨认(三字母组合分析)、踢出(<25词或>20%大写)、令人不安内容(神经网络语言模型)的算法细节。
- CRASE5评分流程图:展示从接收论文开始,依次执行条件码检查(1-8步),若无触发则进入通用模型评分,最后至少由一名人工评分员完成(除空响应和离题外)的完整步骤。
- 参考文献及ACT简介:列出了自动评分标准、ETS分析方法等关键引用,以及ACT机构的使命与业务范围。
本页内容由川海智库整理,用于帮助读者快速了解报告主题、核心观点和主要内容。由于报告量大、人工能力有限,部分观点、数据、统计口径或表述可能存在偏差,具体内容请以完整报告原文为准。





