报告概述
本报告由RAND Project AIR FORCE受美国空军总部委托完成,系统评估了2023年空军军官和士兵绩效评估系统的多项改革。研究对象包括Regular component的全体官兵,覆盖绩效简报(OPB/EPB)的重新设计、从要点式改为叙事性写作、军官静态截止日期的引入、军官和高级士官分级政策的调整、基于空军领导素质(ALQ)的发展性反馈与熟练度评级,以及myEval 2.0电子系统的实施。研究采用混合方法:对分层随机样本进行问卷调查、开展焦点小组与访谈(包括评估者、被评估者、高层审核者及晋升委员会成员),并分析myEval系统内完成的绩效评估数据。报告构建了逻辑模型与评估框架,旨在衡量改革是否达到预期效果,并为空军人才管理利益相关方提供独立分析。读者可借此了解改革在沟通标准、记录绩效、支持人才决策方面的实际影响,以及后续改进方向。
报告的核心结论
绩效简报重新设计整体获好评,但仍有信息量不足问题。
多数官兵对重新设计的OPB和EPB表示满意,主要绩效领域框架有助于按空军价值观记录业绩,高层审核者独立评估块被董事会视为最关键板块之一。然而,删除额外评估者块和EPB总体绩效评估等级后,董事会认为区分不同绩效水平的信息减少,尤其是士官评估中定量数据不足,难以区分所有专业领域人员。
叙事性写作提升了清晰度,但空间限制和写作质量差异带来挑战。
官兵普遍认为叙事性陈述比过去的要点式更清晰地传达了绩效和潜力,董事会成员尤其肯定减少缩写便于跨专业审阅。但完整句子和缩写限制占用了更多空间,部分考核者反映无法充分展示成绩。此外,考核者的写作能力参差不齐,影响评估信息质量。
静态截止日期减少了分级博弈,但政策执行存在混乱。
军官静态截止日期的引入被广泛认为增强了分级公平性,减少了往年“多个第一名”等钻空子行为。然而,部分高层审核者对新分级规则的理解不一致,如分母计算、允许分级比例等,导致合规性问题。同时,SCOD与人才管理董事会的时间衔接仍需优化。
ALQ反馈框架受认可,但反馈实际提供率有待提升。
基于空军领导素质的反馈框架为考核者提供了较好的结构化指导,多数考核者表示有能力提供诚实评级。但调查显示,近半数被评估者未收到中期反馈或最终ALQ熟练度评级,部分考核者仍受制于回避负面评价的文化。评分数据也显示高等级人员间评分差异缩小。
myEval 2.0功能满意度较高,但跟踪和编辑等功能仍需改进。
多数使用者对myEval 2.0的易用性和稳定性给予正面评价,认为其比旧系统更高效。但共同的困难包括:无法查看评估流转状态、纠正预填信息困难、字间距问题以及缺乏版本控制功能。行政人员还面临站点删除、跨系统数据不一致等复杂问题。
报告回答的关键问题
空军2023年绩效评估改革包括哪些主要变化?
改革涵盖五大方面:绩效简报重新设计(引入MPA框架、删除EPB总体评级和Whole Airman板块、增加HLR独立评估块);从要点式改为叙事性书写并限制缩写;军官评估实行静态截止日期;调整军官和士官分级政策(士官分级上限提高至25%);实施基于ALQ的发展性反馈和熟练度评级;以及全面启用myEval 2.0电子系统。
myEval 2.0系统存在哪些主要问题?
虽然多数用户认为myEval 2.0比旧系统更易用高效,但突出困难包括:无法追踪评估流转状态(占比超40%)、纠正预填标准信息困难、字间距问题、缺乏变更跟踪功能。行政人员还面临站点删除、军事人员数据系统格式不兼容等问题。约20%受访者表示未找到任何使用困难。
改革对晋升委员会区分绩效有何影响?
董事会成员普遍认为新设计中HLR评估块和分级信息最具区分力,叙事性书写相比要点式更清晰。但删除额外评估者块和EPB总体评级减少了可用信息,尤其EPB缺乏定量数据(如不足25%的士官有分级数据)导致董事会难以在所有专业领域有效区分人员。
ALQ反馈体系的实际实施效果如何?
ALQ框架被认为提供了良好的反馈结构,多数考核者觉得可以给出诚实评级。然而,仅67%官兵报告收到初始反馈,56%收到中期反馈;且仅有46%表示在签署绩效简报前看到了ALQ熟练度评级。考核者回避负面评价的文化依然存在,高等级人员评分差异较小。
报告中的代表性数据
对SCOD改善评级准确性的看法
2024年调查,针对高层审核者的调查结果:26.6%强烈不同意SCOD使评级更困难,38.1%不同意,仅14.2%同意。表示SCOD并未增加准确分级难度。
MPA框架帮助理解自身优势的比例
2024年调查,作为被评估者,仅31.2%同意OPB/EPB叙事评论帮助理解自身优势;另有24.1%中立。表明MPA框架在沟通个人优势方面仍有提升空间。
以上数据根据报告摘要整理,具体统计口径和数值请以完整报告原文为准。
完整报告包含什么
- 完整的研究逻辑模型(Logic Model):详细展示了改革投入、活动、产出和短期至长期成果之间的因果关系,为持续监测提供框架。
- 详细的调查方法论与问卷:包括分层随机样本设计、加权调整、各角色边际误差表(如HLR为±3.1%),以及完整的调查问题。
- 绩效简报重新设计的分项分析:对MPA框架、删除额外评估者块、删除EPB总体评级、移除Whole Airman板块、新增HLR评估块等每一项变化的调查、焦点小组和董事会访谈结果。
- 叙事性写作改革的多维度评估:包含对清晰度、缩略语使用、空间限制、写作质量变异性的定量与定性数据,以及联合部队视角的反馈。
- 静态截止日期与分级政策的合规性数据:按军衔、HLR规模展示分级深度分布图;分析HLR在分子重复、分母不一致、分母膨胀等方面的不合规率(如平均20%的HLR在初级分级中重复使用分子)。
- ALQ反馈与熟练度评级的实施数据:包括初始/中期反馈提供率、熟练度评级完成率(2024年比2023年略有提升)、各等级评分方差分布图,以及被评估者收到反馈后采取的行动统计(38.4%寻求主管指导)。
- myEval 2.0系统的技术问题与建议:附录A汇编了2916名受访者的3178条评论,分为行政、基础设施、软件编程和跨领域四类问题,并给出具体解决建议(如添加自动保存、跟踪功能)。
- 附件(Annex):提供更详细的评估框架、指标清单和完整研究方法,包括数据来源说明和限制条件。
本页内容由川海智库整理,用于帮助读者快速了解报告主题、核心观点和主要内容。由于报告量大、人工能力有限,部分观点、数据、统计口径或表述可能存在偏差,具体内容请以完整报告原文为准。
相关报告

Visions to Reality: Achieving the Middle East and North Africa's Economic Ambitions

How Public School–Based Pre-K Teachers Use and Combine Instructional Materials

Time as Resource and Experience: An Interdisciplinary Framework for Understanding the True Cost of Caregiving

Evaluation of the Peaceful Connections Violence Prevention Program

Accelerating Puerto Rico's Disaster Recovery: A Synthesis of Findings and Recommendations
