发布日期:08-09
形成性教育评价最容易被误解的一点,是把它理解成:
“增加一些小测验,然后多给学生几次分数。”
但真正的形成性评价关注的并不是:
测了多少次,
而是:
教师获得了什么学习证据,又怎样利用这些证据改变下一步教学。
OECD在2025年关于高质量教学的研究中,将形成性评价描述为一个持续循环:明确学习目标、诊断学生学习状况、提供反馈,再根据学生的真实思维调整教学。也就是说,评价只有真正进入下一步教学决策,才发挥了形成性作用。
这也使形成性教育评价国际论坛的专业语言具有鲜明特点:
Learning Goal → Evidence → Interpretation → Feedback → Instructional Adjustment → New Evidence。
心译翻译曾为第五届形成性教育评价高峰论坛提供专业语言支持,相关项目案例可参见:第五届形成性教育评价高峰论坛共探教育评价创新。
一、Evidence of Learning为什么比“考试成绩”范围大得多?
形成性评价中非常重要的概念是:
Evidence of Learning
可以理解为:
学习证据。
它不只是试卷上的:
82分。
学习证据还可能来自:
学生的一次回答;
一道课堂练习;
小组讨论;
作业草稿;
概念图;
实验过程;
项目作品。
OECD特别强调,教师需要通过任务和课堂活动“引出”学生的思考,从而判断学生当前究竟理解到什么程度。
所以形成性评价真正的问题不是:
How many points did the student get?
而是:
What does this response tell us about the student’s thinking?
这就是教育评价从:
分数管理
走向:
学习诊断
的重要变化。
二、Elicit Student Thinking为什么不是普通“提问”?
教育评价研究中经常出现:
Elicit Student Thinking
或者:
Elicit Evidence of Learning。
这里的elicit不是简单:
“向学生提一个问题”。
它强调的是:
有意识地设计问题,让学生的思考过程显现出来。
例如数学课上,老师问:
“答案是多少?”
可能只能知道:
学生答对还是答错。
如果进一步问:
“为什么这样算?”
“如果条件改变,会发生什么?”
教师才能判断:
学生究竟理解了概念,还是刚好套对公式。
OECD也把“诊断学生学习”描述为教师通过问题或任务捕捉学生推理,以判断不同层次的理解。
所以:
Questioning ≠ Diagnosing Learning。
真正关键的是:
问题能不能让思维变得可见。
三、Misconception为什么比“答错了”更重要?
形成性评价特别关注:
Misconception
即:
错误概念 / 概念误解。
学生答错一道题可能只是:
粗心。
但如果连续出现同一种错误,
可能意味着:
他脑中建立了一个错误的知识模型。
例如学生并不是不会计算,
而是:
对比例概念本身理解错误。
这时教师下一步需要做的就不是:
再布置十道同类型题。
而是:
重新设计教学,纠正错误概念。
因此国际教育评价论坛中:
error
mistake
misconception
虽然中文都可能表现为“错误”,
专业意义却不同。
四、Learning Progression为什么比一次考试更接近“成长”?
形成性评价还经常讨论:
Learning Progression
通常可以译为:
学习进阶 / 学习发展进程。
它关注:
学生从初步理解,到熟练掌握,再到复杂应用,中间会经过哪些发展阶段。
例如写作能力并不是:
不会写 → 突然会写。
而可能逐步表现为:
能表达观点;
能组织段落;
能使用证据;
能处理反方观点;
能形成完整论证。
因此形成性评价真正关注的是:
Where is the learner now?
以及:
What is the next achievable step?
这比单独判断:
“这次考了多少分”
更接近学习发展的本质。
五、Hinge Question为什么是一种非常典型的形成性评价工具?
课堂评价中有一种很有代表性的概念:
Hinge Question
可以理解为:
关键节点问题。
教师通常会在进入下一阶段教学以前提出一个问题。
目的不是:
给学生记成绩。
而是判断:
全班是否已经具备继续学习的基础。
如果大部分学生理解了:
继续下一部分。
如果大量学生出现同样的错误:
调整讲解。
因此一个Hinge Question真正决定的是:
Next Instructional Move / 下一步教学行动。
这很好地解释了形成性评价为什么不是:
Assessment之后就结束,
而是:
Assessment改变Instruction。
六、Feedback Loop为什么比Feedback本身更重要?
第五届这篇可以特别强调:
Feedback Loop / 反馈闭环。
很多课堂实际上存在:
Teacher gives feedback。
但没有:
Student acts on feedback。
例如老师在作文上写满修改意见,
学生看一眼:
得到分数,然后把作文塞进书包。
这其实没有真正形成:
Feedback Loop。
OECD指出,有效反馈不仅需要告诉学生当前表现与学习目标之间的差距,还应让学生有机会理解并根据反馈采取行动,随后再产生新的学习证据。
因此真正的循环是:
Performance → Feedback → Student Action → New Performance。
这比:
“老师有没有写评语”
重要得多。
七、Feedback Literacy为什么开始受到重视?
现在教育研究进一步讨论:
Feedback Literacy
可以译为:
反馈素养。
它关注的不只是:
教师会不会给反馈,
还包括:
学生会不会使用反馈。
例如学生能不能:
理解老师的意见;
判断哪些地方需要修改;
根据反馈重新完成任务;
主动寻找进一步的信息。
因此高质量反馈并不是教师单方面:
“输出正确答案”。
而是逐渐培养学生:
Interpret → Judge → Act。
最终学生能够:
自己判断自己的学习状态。
这又与:
self-regulated learning / 自我调节学习
紧密联系。
OECD同样强调,形成性评价获得的信息应帮助学生逐渐参与并引导自己的学习过程。
八、Assessment Literacy为什么是一线教师的重要专业能力?
国际教育会议中越来越高频:
Assessment Literacy
通常译为:
评价素养。
它不是:
“老师会不会出试卷”。
真正的评价素养包括:
知道为什么评价;
知道应该收集什么证据;
能判断证据说明了什么;
能识别评价工具的局限;
能根据结果调整教学。
因此一位教师可能很会:
出题、打分,
却不一定拥有很强的:
Formative Assessment Literacy。
因为形成性评价更加考验:
从学生表现中推断学习状态的能力。
九、Data-Informed Instruction为什么比Data-Driven更值得注意?
教育数字化以后,经常出现:
Data-Driven Instruction
或者:
Data-Informed Instruction。
二者看起来很像。
Data-Driven容易给人一种印象:
数据直接决定教学。
而Data-Informed更强调:
数据为教师判断提供信息,但最终仍然需要专业判断。
例如系统显示:
60%的学生在某一道题上答错。
数据只能告诉教师:
出现了问题。
但它不能自动解释:
为什么错?
是知识点不会?
题目表达不清?
还是学生误解了概念?
因此形成性评价更合理的逻辑是:
Data+Professional Judgment → Instructional Decision。
十、Learning Analytics怎样改变形成性评价?
数字化教育进一步带来了:
Learning Analytics / 学习分析。
通过学习平台,教师可能看到:
答题正确率;
学习时间;
知识点掌握情况;
任务完成进度;
学习路径。
UNESCO早期关于Learning Analytics的研究就指出,学习数据可以通过计算分析和可视化帮助教育者理解学习动态,并支持更加基于证据的教育决策,同时也需要注意计算模型本身的局限和伦理问题。
因此数字评价正在把过去的:
“考试结束以后再分析”
逐渐变成:
Continuous Learning Data。
十一、Dashboard为什么不能只理解成“教育数据大屏”?
数字教育中经常出现:
Learning Dashboard / 学习仪表板。
它可能显示:
哪些学生没有完成任务;
哪些知识点错误率高;
学习进度是否落后;
哪些学生需要进一步支持。
但Dashboard真正的价值不是:
图表看起来很漂亮。
而是:
教师看完以后有没有采取行动。
如果一所学校拥有大量:
colourful charts,
但教师不知道:
下一堂课应该改变什么,
那么它仍然只是:
数据展示。
真正有价值的学习分析应该实现:
Data → Insight → Intervention。
十二、Validity、Reliability和Fairness为什么是评价研究绕不开的三组词?
教育评价论坛不能只讨论:
“工具很好不好用”。
还会进一步进入:
Validity / 效度
Reliability / 信度
Fairness / 公平性。
简单来说:
Validity
关注:
这个工具究竟有没有测到我们真正想测的东西?
Reliability
关注:
测量结果是否具有足够的一致性和稳定性?
Fairness
则进一步关注:
对不同学生群体是否公平。
例如一个测试号称测:
科学推理能力,
但题目本身语言极其复杂,
那么最终成绩可能同时受到:
阅读能力
影响。
因此教育评价翻译尤其不能把:
validity
简单理解成:
“这个考试有效”。
它是一整套:
Measurement Quality
概念。
十三、Inter-rater Reliability为什么会出现在Rubric评价里?
当评价从选择题进入:
作文;
演讲;
项目;
Portfolio,
往往需要教师进行人工评分。
于是会出现:
Inter-rater Reliability
通常译为:
评分者间信度 / 评定者间一致性。
例如同一篇作文:
A老师给90分;
B老师给65分,
说明评价标准可能还不够稳定。
因此Rubric的重要作用之一就是:
让不同教师对“优秀”“合格”“需要改进”形成更明确的共同标准。
这时形成性评价已经进入:
教育测量+教师专业判断
的交叉区域。
十四、AI会不会让形成性评价变成“机器批作业”?
生成式AI让教育评价出现新的可能:
automated feedback
adaptive assessment
personalized feedback
AI tutor。
AI确实可以快速分析大量学习数据,甚至根据学生表现生成个性化建议。UNESCO也已经探索利用AI从复杂的大规模学习评价数据中提取可操作信息,用于支持教育政策和实践决策。
但:
AI-generated Feedback ≠ Automatically Good Feedback。
系统仍然可能:
错误判断学生意图;
生成不准确解释;
忽略课堂语境;
暴露学生数据;
放大数据偏差。
UNESCO关于生成式AI教育应用的指导因此强调,以人为中心的应用方式、数据隐私、伦理验证和教育设计都不能被忽略。
十五、为什么教师不会因为AI评价而失去作用?
AI可以非常擅长:
批量分析数据;
发现模式;
生成初步反馈;
对学习表现进行分类。
但教师还需要判断:
这个学生为什么突然退步?
他是真的没学会,还是当天状态不好?
一个错误代表个体问题还是整个班级的教学问题?
应该重新讲解,还是换一种任务?
因此形成性评价真正需要的仍然是:
AI Analytics+Teacher Judgment。
AI可以帮助回答:
“发生了什么?”
教师需要继续回答:
“为什么发生,以及下一步怎么办?”
这也是未来教育评价最值得关注的分工。
十六、为什么形成性评价论坛特别考验学术翻译的“逻辑精度”?
这类会议的大量词汇单独看并不困难:
evidence
progress
performance
achievement
attainment
feedback
diagnosis。
真正难的是:
它们在教育研究中分别承担什么作用。
例如:
Performance
可能是某一次任务中的表现。
Progress
强调一段时间里的进步。
Attainment / Achievement
则更加接近已经达到的学习水平或学习成就。
如果全部统一处理成:
“学习成绩”,
就会把形成性评价最重要的:
学习过程与发展变化
重新压缩成一个静态分数。
因此专业教育会议同声传译首先需要理解:
Educational Logic
再选择语言。
十七、AI+人工怎样准备形成性教育评价国际论坛?
这类论坛的资料往往包含:
教育研究论文;
课堂案例;
Rubric;
数据图表;
学习平台截图;
评价模型;
教师培训材料。
AI可以帮助提前:
提取专业术语;
区分Assessment、Evaluation和Measurement;
建立Learning Evidence与Feedback相关词库;
提取研究方法和数据;
对比中英文PPT;
按课堂评价、数据分析和AI教育进行资料分类。
但最终仍需要人工确认:
attainment和progress有没有混淆;
evidence到底是学习证据还是研究证据;
validity和reliability是否准确;
AI研究结论有没有被过度强化;
数据相关表达是否符合教育研究语境。
因此更加适合这类国际论坛的工作流是:
AI资料整理+教育评价术语核验+研究逻辑人工判断+同声传译+数据与学术表达专项QA。
结语:形成性评价真正改变的不是“怎么考试”,而是“教师怎样决定下一步怎么教”
形成性评价最重要的价值,不在于:
多收集一些数据。
真正有意义的是:
这些信息有没有重新进入教学。
OECD对形成性评价的最新总结同样把它描述成一个持续、循环的过程:教师明确目标、了解学生思维、提供反馈,并不断根据新的学习证据调整教学。
因此它真正形成的是:
Learning Goal → Evidence → Interpretation → Feedback → Instructional Decision → New Evidence。
如果评价结束以后:
教师照样按照原计划往下讲;
学生拿到分数以后什么也不改变,
那么无论使用:
Paper Test、Digital Platform还是AI,
都没有真正完成:
Formative Assessment。
而当评价真正帮助教师判断:
学生现在在哪里?
为什么没有理解?
下一步最需要什么?
它才从:
Measurement
转化为:
Learning Improvement。
这正是第五届形成性教育评价高峰论坛这类国际教育交流活动,对专业会议翻译提出的特殊要求:译员不仅需要准确处理教育术语,更需要理解学习证据如何被解释、反馈如何形成闭环、数据如何进入课堂决策,以及AI怎样重新定义教师与评价工具之间的关系。
心译翻译可为高校、国际学校、教育研究机构、教育科技企业及教育评价项目提供国际教育会议翻译、教育学同声传译、形成性评价与教育测量资料翻译、数字教育与AI教育内容本地化、多语种学术传播以及AI+人工审校,通过教育评价术语库、会议论文译前分析和研究数据专项QA,帮助复杂的教育理论与课堂实践更加准确地进入国际交流。
相关项目案例:
第五届形成性教育评价高峰论坛共探教育评价创新
这一篇和第六届就已经形成了很好的同一客户、不同搜索意图:第五届切“课堂证据—教学决策—数据—AI”,第六届切“形成性评价核心概念—Feedback—Rubrics—学生发展”,两篇不会互相重复,反而会互相加强这个教育评价内容集群。
