教育评价会议最容易翻错什么?Assessment、Evaluation、Measurement不是一回事

发布日期:08-26

教育会议里,有些词看起来非常简单。

Assessment。

Evaluation。

Measurement。

Testing。

Feedback。

几乎每个学过英语的人都认识。

但真正进入形成性教育评价、课程研究或教学测评国际会议,就会发现:

教育评价翻译最危险的地方,往往恰恰是这些“大家都认识”的词。

因为它们在中文里经常都能被翻成“评价”“评估”“测评”,但在教育研究中,它们承担的功能并不完全相同。

如果不理解背后的教育逻辑,很容易出现一种情况:

每句话单独听似乎都没有错,

但一场演讲结束以后,

教师评价、学生评价、教学评价、学习测量、考试和反馈之间的关系已经被翻乱了。

心译翻译曾为第三届形成性教育评价高峰论坛提供专业国际会议翻译支持。论坛围绕形成性评价、教学改进、学生发展与教育质量提升等议题展开。

相关项目可参见:

第三届形成性教育评价高峰论坛翻译案例

这类项目说明了教育学术翻译一个非常典型的问题:

真正需要翻译的不是几个教育术语,而是“评价为什么发生、评价谁、评价以后做什么”。


一、Assessment为什么不能永远翻成“评估”?

Assessment可能是教育评价会议里出现频率最高的词之一。

但它真正表达什么,要看研究对象和使用目的。

例如:

student assessment

通常涉及对学生学习状态或学习成果的评价。

classroom assessment

更多指课堂情境中的评价活动。

performance assessment

通常强调通过任务或表现来评价学生能力。

formative assessment

关注学习过程中获取信息,并利用这些信息继续促进学习。

summative assessment

则更多用于总结某一阶段已经取得的学习成果。

OECD在2025年的教学研究中也将 formative assessment 描述为一个持续过程:明确学习目标、了解学生当前的学习状况、提供反馈,并据此调整教学。

所以真正的问题从来不是:

Assessment中文叫什么?

而是:

这次assessment是为了给学生分数,诊断问题,调整教学,认证成果,还是促进下一步学习?

功能不同,语言处理也会不同。


二、Assessment和Evaluation到底有什么区别?

这是一组在教育会议里非常容易混淆的词。

在实际教育研究中,两者的边界会随着国家、学术传统和研究语境变化,并不存在一个所有场景都适用的机械对应关系。

但是理解它们的常见功能差异非常重要。

Assessment

往往更常与:

学生学习、学习过程、能力、表现

联系在一起。

而:

Evaluation

则更容易涉及:

课程、项目、学校、政策、教师发展或整个教育体系

是否有效。

例如:

student assessment

关注学生学得怎么样。

而:

program evaluation

可能研究一个教育项目有没有达到预期效果。

teacher evaluation

可能涉及教师教学表现评价。

school evaluation

则已经进入学校层面的质量评价。

所以如果会议中同时出现:

assessment system

和:

program evaluation

全部统一翻成“评价体系”,

中文虽然通顺,但原本不同的研究对象已经被模糊。

教育学术翻译真正需要首先回答:

Who or what is being evaluated?

到底是在看:

学生?

教师?

课程?

项目?

还是整个教育系统?


三、Measurement不是Assessment:测出了数字,不等于完成了评价

教育评价会议还经常出现:

Measurement / 测量

这是一个特别值得区分的概念。

Measurement更关注:

如何对某种能力、表现或特征进行测量,并形成数据。

例如:

reading proficiency

阅读能力;

mathematical ability

数学能力;

student engagement

学生参与度。

研究人员可能设计量表、测试题目或者统计模型进行测量。

但:

得到一个数字,并不等于已经完成教育评价。

例如一个学生阅读测验得到:

78分。

Measurement回答的是:

“我们测到了什么?”

Assessment进一步需要考虑:

“这个结果说明学生当前学习处于什么状态?”

而形成性评价真正关心的则继续追问:

“接下来怎么教、怎么学?”

因此可以形成一条非常重要的逻辑链:

Measurement
→ Evidence
→ Interpretation
→ Assessment
→ Feedback
→ Instructional Adjustment

即:

测量
→ 学习证据
→ 解释
→ 评价判断
→ 反馈
→ 教学调整。

这条链如果被译乱,形成性评价最核心的教育意义也就容易丢失。


四、Testing只是评价工具之一,考试不等于评价

很多人一听教育评价,第一反应就是:

考试。

但:

Test ≠ Assessment

更不等于:

Formative Assessment。

一场小测验完全可以承担形成性功能。

例如教师在课后用五道题判断学生到底有没有理解一个概念,然后根据结果第二天重新设计教学。

但同样一份小测验,如果只是:

记录成绩;

排名;

归档;

然后继续按照原计划上课,

它就未必真正发挥了形成性作用。

OECD也明确区分了 formative assessment 与 summative assessment:前者利用学习过程中获得的信息继续塑造后续学习,而后者更强调总结、记录或认证已经发生的学习。

所以形成性评价会议里非常关键的一句话其实是:

关键不是有没有测试,而是测试结果有没有改变下一步教学。

这句话背后的逻辑,也是译员必须真正理解的。


五、Score、Grade和Achievement为什么不能全部翻成“成绩”?

中文日常语言里,我们很习惯说:

“这个孩子成绩很好。”

但是英文教育研究中的“成绩”,可能对应完全不同的概念。

Score

通常是某次测验、考试或量表获得的具体分数。

Grade

可能是课程成绩、等级,也可能与某些教育体系中的年级概念发生重叠,需要结合语境。

Achievement

通常更接近:

学习成就、学业成就。

Attainment

在部分教育研究体系中则强调学生已经达到的学习水平。

Performance

更多可以描述学生在某次任务、测试或者具体情境中的表现。

如果这些词全部统一成:

“成绩”,

就会把教育研究里非常重要的:

一次表现、量化分数和长期学习成就

压成一个概念。

形成性评价尤其关注:

变化。

所以还必须区分:

performance

和:

progress。

一个学生目前表现不高,

并不意味着:

没有进步。

而形成性评价真正经常研究的,恰恰是:

学生从哪里开始,现在走到了哪里。


六、Feedback不是“老师点评几句”

Feedback也是形成性评价国际会议里的核心概念。

中文习惯把它译成:

反馈。

词本身没有问题。

真正的问题是:

什么才算真正有效的反馈?

OECD 2025年的相关研究强调,反馈应当针对学生当前表现与学习目标之间的关系,帮助学生理解如何缩小当前表现与目标之间的差距;反馈不是一次性动作,而可能形成持续循环。

因此:

“Very good!”

当然是一种回应,

但未必构成有充分学习价值的反馈。

真正具有形成性作用的反馈需要帮助学生知道:

我现在在哪里?

目标是什么?

哪里还没有达到?

下一步应该做什么?

于是:

Feedback

在形成性评价体系中不是:

Teacher Comment / 教师点评,

而更接近:

Information for Further Learning / 用于推动下一步学习的信息。

如果译员不了解这一点,就很容易把教育理论里的 feedback 翻成一种非常日常化、甚至接近“意见反馈”的概念。


七、Learning Goal和Success Criteria不是一回事

形成性评价讨论经常从:

learning goals

开始。

但会议现场还会出现:

learning objectives
learning intentions
success criteria
expected outcomes

这些词互相关联,却并不完全相同。

例如:

Learning Goal

回答:

学生需要学习什么?

而:

Success Criteria

进一步回答:

做到什么程度,才说明达到了这个学习目标?

假设教学目标是:

“学生能够写出有论据支持的议论文。”

那么success criteria可能进一步包括:

论点是否明确;

证据是否相关;

论证是否具有逻辑;

文章结构是否完整。

于是:

Learning Goal

和:

Success Criteria

实际上处于两个不同层级。

如果全部简单处理成:

“学习目标”,

就会损失形成性评价中非常重要的评价依据。


八、Rubric真正难翻的不是这个单词,而是里面每一级标准

形成性评价会议里还经常讨论:

Rubric

通常可译为:

评价量规、评分量规。

但是对于翻译而言,真正困难的通常不是rubric这个词。

而是其中大量表示程度的语言。

例如:

emerging
developing
proficient
advanced

或者:

limited
adequate
effective
highly effective

这些词并不是普通意义上的形容词。

它们往往代表:

不同能力等级之间经过设计的评价边界。

如果中文版本出现:

一般;

还行;

较好;

很好,

虽然“意思差不多”,

但量规本身已经失去专业性。

因此教育评价资料本地化不仅需要:

Terminology Consistency / 术语一致性,

还需要:

Scale Consistency / 等级尺度一致性。

同一套评价标准中,

“基本达到”

和:

“达到”

与:

“熟练达到”

之间必须形成稳定的等级关系。

这也是教育评价资料与普通宣传材料翻译非常不同的地方。


九、同一个教育概念,为什么到了另一个国家不能只做字面对应?

国际教育论坛还有一个非常特殊的问题:

教育制度不同。

例如不同国家对:

curriculum
standard
qualification
credit
grade
assessment
certification

背后的制度设计可能完全不同。

同一个:

Grade

在一种语境里可能与:

学生所处年级

有关;

在另一种语境里则可能表示:

课程等级或成绩。

同样:

Standard

可能是:

课程标准;

学习标准;

专业标准;

甚至资格标准。

这时候最危险的方法就是:

看到一个英文词,

立刻寻找一个固定中文词。

更好的翻译逻辑应该是:

Term
→ Educational System
→ Function
→ Context
→ Chinese Expression

即:

术语
→ 所属教育体系
→ 它承担什么功能
→ 当前具体语境
→ 再决定中文表达。

这也是中外教育交流中真正需要“本地化”,而不仅是“语言转换”的原因。


十、为什么形成性评价尤其强调学生的主体性?

过去谈教育评价,很容易形成一种结构:

教师评价学生。

但现代形成性评价越来越强调:

学生本身也应该理解学习目标、评价标准以及自己的学习进展。

OECD 2025年的研究特别提到,形成性评价不仅要求教师诊断学习、提供反馈和调整教学,也需要让学生拥有一定的能动性,参与和引导自己的学习过程。

因此国际教育会议中会越来越多出现:

self-assessment
peer assessment
student agency
self-regulated learning
learner autonomy

这些概念其实共同指向一个变化:

评价不再只是:

Teacher → Student

而逐渐变成:

Teacher ↔ Student ↔ Evidence ↔ Learning

学生开始参与理解:

我为什么学习?

我要达到什么?

我现在在哪里?

我下一步应该做什么?

这也是形成性评价最终想改变的:

不是考试本身,而是学生与学习之间的关系。


十一、教育评价会议的译前准备,不应该只有一张术语表

对于形成性教育评价高峰论坛这类会议,我更建议将译前准备按照“教育评价系统”组织。

例如先建立几个概念模块:

Learning:learning goal、learning outcome、progress、achievement;

Assessment:formative assessment、summative assessment、performance assessment、self-assessment;

Evidence:learning evidence、observation、task、test、portfolio;

Feedback:teacher feedback、peer feedback、feedback loop;

Measurement:score、scale、reliability、validity;

Instruction:instructional adjustment、differentiated instruction、pedagogical response。

然后再建立这些概念之间的关系。

真正需要译员掌握的不是:

formative assessment = 形成性评价。

而是:

形成性评价为什么会同时出现目标、证据、反馈和教学调整。

一旦这条逻辑真正理解,现场即使出现新的表达,也更容易进行准确判断。


十二、教育评价翻译,本质上是在保护“学习是怎样发生的”

第三届形成性教育评价高峰论坛所代表的,并不是简单意义上的:

“怎样考试”。

它真正讨论的是:

教师如何知道学生学到了哪里;
怎样识别学生还没有理解的部分;
怎样把评价信息变成反馈;
又怎样根据这些信息改变下一步教学。

这也是为什么教育评价翻译不能停留在:

Assessment = 评价;

Feedback = 反馈;

Rubric = 量规。

专业翻译需要继续理解这些词之间的教育逻辑:

Learning Goal
→ Evidence of Learning
→ Interpretation
→ Feedback
→ Instructional Adjustment
→ Student Progress

心译翻译通过国际教育会议翻译、教育学同声传译、教育评价与课程研究资料翻译、多语种学术内容本地化以及AI辅助与人工审校,为高校、学校、教育研究机构及国际教育合作项目提供专业语言支持。

对于教育评价会议而言,真正准确的翻译并不是:

把每一个教育术语都找到一个中文对应词。

而是:

让一套关于“学生怎样学习、教师怎样判断、教学怎样改变”的教育逻辑,在另一种语言里仍然完整成立。

截屏2026-08-26 09.14.20.jpg