形成性教育评价国际论坛如何做好专业翻译?从Evidence of Learning、Assessment Literacy到数据驱动教学与AI反馈

发布日期:08-09

形成性教育评价最容易被误解的一点,是把它理解成:

“增加一些小测验,然后多给学生几次分数。”

但真正的形成性评价关注的并不是:

测了多少次,

而是:

教师获得了什么学习证据,又怎样利用这些证据改变下一步教学。

OECD在2025年关于高质量教学的研究中,将形成性评价描述为一个持续循环:明确学习目标、诊断学生学习状况、提供反馈,再根据学生的真实思维调整教学。也就是说,评价只有真正进入下一步教学决策,才发挥了形成性作用。

这也使形成性教育评价国际论坛的专业语言具有鲜明特点:

Learning Goal → Evidence → Interpretation → Feedback → Instructional Adjustment → New Evidence。

心译翻译曾为第五届形成性教育评价高峰论坛提供专业语言支持,相关项目案例可参见:第五届形成性教育评价高峰论坛共探教育评价创新


一、Evidence of Learning为什么比“考试成绩”范围大得多?

形成性评价中非常重要的概念是:

Evidence of Learning

可以理解为:

学习证据。

它不只是试卷上的:

82分。

学习证据还可能来自:

学生的一次回答;

一道课堂练习;

小组讨论;

作业草稿;

概念图;

实验过程;

项目作品。

OECD特别强调,教师需要通过任务和课堂活动“引出”学生的思考,从而判断学生当前究竟理解到什么程度。

所以形成性评价真正的问题不是:

How many points did the student get?

而是:

What does this response tell us about the student’s thinking?

这就是教育评价从:

分数管理

走向:

学习诊断

的重要变化。


二、Elicit Student Thinking为什么不是普通“提问”?

教育评价研究中经常出现:

Elicit Student Thinking

或者:

Elicit Evidence of Learning。

这里的elicit不是简单:

“向学生提一个问题”。

它强调的是:

有意识地设计问题,让学生的思考过程显现出来。

例如数学课上,老师问:

“答案是多少?”

可能只能知道:

学生答对还是答错。

如果进一步问:

“为什么这样算?”

“如果条件改变,会发生什么?”

教师才能判断:

学生究竟理解了概念,还是刚好套对公式。

OECD也把“诊断学生学习”描述为教师通过问题或任务捕捉学生推理,以判断不同层次的理解。

所以:

Questioning ≠ Diagnosing Learning。

真正关键的是:

问题能不能让思维变得可见。


三、Misconception为什么比“答错了”更重要?

形成性评价特别关注:

Misconception

即:

错误概念 / 概念误解。

学生答错一道题可能只是:

粗心。

但如果连续出现同一种错误,

可能意味着:

他脑中建立了一个错误的知识模型。

例如学生并不是不会计算,

而是:

对比例概念本身理解错误。

这时教师下一步需要做的就不是:

再布置十道同类型题。

而是:

重新设计教学,纠正错误概念。

因此国际教育评价论坛中:

error
mistake
misconception

虽然中文都可能表现为“错误”,

专业意义却不同。


四、Learning Progression为什么比一次考试更接近“成长”?

形成性评价还经常讨论:

Learning Progression

通常可以译为:

学习进阶 / 学习发展进程。

它关注:

学生从初步理解,到熟练掌握,再到复杂应用,中间会经过哪些发展阶段。

例如写作能力并不是:

不会写 → 突然会写。

而可能逐步表现为:

能表达观点;

能组织段落;

能使用证据;

能处理反方观点;

能形成完整论证。

因此形成性评价真正关注的是:

Where is the learner now?

以及:

What is the next achievable step?

这比单独判断:

“这次考了多少分”

更接近学习发展的本质。


五、Hinge Question为什么是一种非常典型的形成性评价工具?

课堂评价中有一种很有代表性的概念:

Hinge Question

可以理解为:

关键节点问题。

教师通常会在进入下一阶段教学以前提出一个问题。

目的不是:

给学生记成绩。

而是判断:

全班是否已经具备继续学习的基础。

如果大部分学生理解了:

继续下一部分。

如果大量学生出现同样的错误:

调整讲解。

因此一个Hinge Question真正决定的是:

Next Instructional Move / 下一步教学行动。

这很好地解释了形成性评价为什么不是:

Assessment之后就结束,

而是:

Assessment改变Instruction。


六、Feedback Loop为什么比Feedback本身更重要?

第五届这篇可以特别强调:

Feedback Loop / 反馈闭环。

很多课堂实际上存在:

Teacher gives feedback。

但没有:

Student acts on feedback。

例如老师在作文上写满修改意见,

学生看一眼:

得到分数,然后把作文塞进书包。

这其实没有真正形成:

Feedback Loop。

OECD指出,有效反馈不仅需要告诉学生当前表现与学习目标之间的差距,还应让学生有机会理解并根据反馈采取行动,随后再产生新的学习证据。

因此真正的循环是:

Performance → Feedback → Student Action → New Performance。

这比:

“老师有没有写评语”

重要得多。


七、Feedback Literacy为什么开始受到重视?

现在教育研究进一步讨论:

Feedback Literacy

可以译为:

反馈素养。

它关注的不只是:

教师会不会给反馈,

还包括:

学生会不会使用反馈。

例如学生能不能:

理解老师的意见;

判断哪些地方需要修改;

根据反馈重新完成任务;

主动寻找进一步的信息。

因此高质量反馈并不是教师单方面:

“输出正确答案”。

而是逐渐培养学生:

Interpret → Judge → Act。

最终学生能够:

自己判断自己的学习状态。

这又与:

self-regulated learning / 自我调节学习

紧密联系。

OECD同样强调,形成性评价获得的信息应帮助学生逐渐参与并引导自己的学习过程。


八、Assessment Literacy为什么是一线教师的重要专业能力?

国际教育会议中越来越高频:

Assessment Literacy

通常译为:

评价素养。

它不是:

“老师会不会出试卷”。

真正的评价素养包括:

知道为什么评价;

知道应该收集什么证据;

能判断证据说明了什么;

能识别评价工具的局限;

能根据结果调整教学。

因此一位教师可能很会:

出题、打分,

却不一定拥有很强的:

Formative Assessment Literacy。

因为形成性评价更加考验:

从学生表现中推断学习状态的能力。


九、Data-Informed Instruction为什么比Data-Driven更值得注意?

教育数字化以后,经常出现:

Data-Driven Instruction

或者:

Data-Informed Instruction。

二者看起来很像。

Data-Driven容易给人一种印象:

数据直接决定教学。

而Data-Informed更强调:

数据为教师判断提供信息,但最终仍然需要专业判断。

例如系统显示:

60%的学生在某一道题上答错。

数据只能告诉教师:

出现了问题。

但它不能自动解释:

为什么错?

是知识点不会?

题目表达不清?

还是学生误解了概念?

因此形成性评价更合理的逻辑是:

Data+Professional Judgment → Instructional Decision。


十、Learning Analytics怎样改变形成性评价?

数字化教育进一步带来了:

Learning Analytics / 学习分析。

通过学习平台,教师可能看到:

答题正确率;

学习时间;

知识点掌握情况;

任务完成进度;

学习路径。

UNESCO早期关于Learning Analytics的研究就指出,学习数据可以通过计算分析和可视化帮助教育者理解学习动态,并支持更加基于证据的教育决策,同时也需要注意计算模型本身的局限和伦理问题。

因此数字评价正在把过去的:

“考试结束以后再分析”

逐渐变成:

Continuous Learning Data。


十一、Dashboard为什么不能只理解成“教育数据大屏”?

数字教育中经常出现:

Learning Dashboard / 学习仪表板。

它可能显示:

哪些学生没有完成任务;

哪些知识点错误率高;

学习进度是否落后;

哪些学生需要进一步支持。

但Dashboard真正的价值不是:

图表看起来很漂亮。

而是:

教师看完以后有没有采取行动。

如果一所学校拥有大量:

colourful charts,

但教师不知道:

下一堂课应该改变什么,

那么它仍然只是:

数据展示。

真正有价值的学习分析应该实现:

Data → Insight → Intervention。


十二、Validity、Reliability和Fairness为什么是评价研究绕不开的三组词?

教育评价论坛不能只讨论:

“工具很好不好用”。

还会进一步进入:

Validity / 效度

Reliability / 信度

Fairness / 公平性。

简单来说:

Validity

关注:

这个工具究竟有没有测到我们真正想测的东西?

Reliability

关注:

测量结果是否具有足够的一致性和稳定性?

Fairness

则进一步关注:

对不同学生群体是否公平。

例如一个测试号称测:

科学推理能力,

但题目本身语言极其复杂,

那么最终成绩可能同时受到:

阅读能力

影响。

因此教育评价翻译尤其不能把:

validity

简单理解成:

“这个考试有效”。

它是一整套:

Measurement Quality

概念。


十三、Inter-rater Reliability为什么会出现在Rubric评价里?

当评价从选择题进入:

作文;

演讲;

项目;

Portfolio,

往往需要教师进行人工评分。

于是会出现:

Inter-rater Reliability

通常译为:

评分者间信度 / 评定者间一致性。

例如同一篇作文:

A老师给90分;

B老师给65分,

说明评价标准可能还不够稳定。

因此Rubric的重要作用之一就是:

让不同教师对“优秀”“合格”“需要改进”形成更明确的共同标准。

这时形成性评价已经进入:

教育测量+教师专业判断

的交叉区域。


十四、AI会不会让形成性评价变成“机器批作业”?

生成式AI让教育评价出现新的可能:

automated feedback
adaptive assessment
personalized feedback
AI tutor。

AI确实可以快速分析大量学习数据,甚至根据学生表现生成个性化建议。UNESCO也已经探索利用AI从复杂的大规模学习评价数据中提取可操作信息,用于支持教育政策和实践决策。

但:

AI-generated Feedback ≠ Automatically Good Feedback。

系统仍然可能:

错误判断学生意图;

生成不准确解释;

忽略课堂语境;

暴露学生数据;

放大数据偏差。

UNESCO关于生成式AI教育应用的指导因此强调,以人为中心的应用方式、数据隐私、伦理验证和教育设计都不能被忽略。


十五、为什么教师不会因为AI评价而失去作用?

AI可以非常擅长:

批量分析数据;

发现模式;

生成初步反馈;

对学习表现进行分类。

但教师还需要判断:

这个学生为什么突然退步?

他是真的没学会,还是当天状态不好?

一个错误代表个体问题还是整个班级的教学问题?

应该重新讲解,还是换一种任务?

因此形成性评价真正需要的仍然是:

AI Analytics+Teacher Judgment。

AI可以帮助回答:

“发生了什么?”

教师需要继续回答:

“为什么发生,以及下一步怎么办?”

这也是未来教育评价最值得关注的分工。


十六、为什么形成性评价论坛特别考验学术翻译的“逻辑精度”?

这类会议的大量词汇单独看并不困难:

evidence
progress
performance
achievement
attainment
feedback
diagnosis。

真正难的是:

它们在教育研究中分别承担什么作用。

例如:

Performance

可能是某一次任务中的表现。

Progress

强调一段时间里的进步。

Attainment / Achievement

则更加接近已经达到的学习水平或学习成就。

如果全部统一处理成:

“学习成绩”,

就会把形成性评价最重要的:

学习过程与发展变化

重新压缩成一个静态分数。

因此专业教育会议同声传译首先需要理解:

Educational Logic

再选择语言。


十七、AI+人工怎样准备形成性教育评价国际论坛?

这类论坛的资料往往包含:

教育研究论文;

课堂案例;

Rubric;

数据图表;

学习平台截图;

评价模型;

教师培训材料。

AI可以帮助提前:

提取专业术语;

区分Assessment、Evaluation和Measurement;

建立Learning Evidence与Feedback相关词库;

提取研究方法和数据;

对比中英文PPT;

按课堂评价、数据分析和AI教育进行资料分类。

但最终仍需要人工确认:

attainment和progress有没有混淆;

evidence到底是学习证据还是研究证据;

validity和reliability是否准确;

AI研究结论有没有被过度强化;

数据相关表达是否符合教育研究语境。

因此更加适合这类国际论坛的工作流是:

AI资料整理+教育评价术语核验+研究逻辑人工判断+同声传译+数据与学术表达专项QA。


结语:形成性评价真正改变的不是“怎么考试”,而是“教师怎样决定下一步怎么教”

形成性评价最重要的价值,不在于:

多收集一些数据。

真正有意义的是:

这些信息有没有重新进入教学。

OECD对形成性评价的最新总结同样把它描述成一个持续、循环的过程:教师明确目标、了解学生思维、提供反馈,并不断根据新的学习证据调整教学。

因此它真正形成的是:

Learning Goal → Evidence → Interpretation → Feedback → Instructional Decision → New Evidence。

如果评价结束以后:

教师照样按照原计划往下讲;

学生拿到分数以后什么也不改变,

那么无论使用:

Paper Test、Digital Platform还是AI,

都没有真正完成:

Formative Assessment。

而当评价真正帮助教师判断:

学生现在在哪里?

为什么没有理解?

下一步最需要什么?

它才从:

Measurement

转化为:

Learning Improvement。

这正是第五届形成性教育评价高峰论坛这类国际教育交流活动,对专业会议翻译提出的特殊要求:译员不仅需要准确处理教育术语,更需要理解学习证据如何被解释、反馈如何形成闭环、数据如何进入课堂决策,以及AI怎样重新定义教师与评价工具之间的关系

心译翻译可为高校、国际学校、教育研究机构、教育科技企业及教育评价项目提供国际教育会议翻译、教育学同声传译、形成性评价与教育测量资料翻译、数字教育与AI教育内容本地化、多语种学术传播以及AI+人工审校,通过教育评价术语库、会议论文译前分析和研究数据专项QA,帮助复杂的教育理论与课堂实践更加准确地进入国际交流。

相关项目案例:
第五届形成性教育评价高峰论坛共探教育评价创新

这一篇和第六届就已经形成了很好的同一客户、不同搜索意图:第五届切“课堂证据—教学决策—数据—AI”,第六届切“形成性评价核心概念—Feedback—Rubrics—学生发展”,两篇不会互相重复,反而会互相加强这个教育评价内容集群。

截屏2026-08-09 15.32.41.jpg