雅思写作评分准确度基准测试

雅思写作评分准确度基准测试:五个平台评测97篇官方评分作文

这是目前网上最全面的雅思写作评分准确度公开对比。

基准测试概览

在这项包含97篇作文的基准测试中,IELTS Writing Practice 是评分最准确的工具。它的平均误差最低(0.53 分),74.2%的评分误差在 0.5 分以内,93.8%在 1 分以内,整体偏差也最小(-0.27)。

它在小作文(Task 1)和大作文(Task 2)上均排名第一,并且在较新的剑桥雅思 20 和 21 作文上保持领先——当较早的材料可能已经出现在模型训练数据中时,这一子集最为关键。

IELTSWritingChecker.org 的完全一致次数多三次(31 对 28),但它误差超过 1 分的次数也是前者的两倍多(13 对 6)。在反映评分与官方分数接近程度的指标上,IELTS Writing Practice 领先。

97篇已公布且有官方评分的作文

整体准确度结果

全部五个平台在完整的97篇作文集上的平均绝对误差、阈值内占比(含边界值)、带符号偏差和完全一致次数。图表中误差指标保留两位小数,百分比保留一位小数,次数为精确值。

分数误差

平均绝对误差

越低越好
IELTS Writing Practice
0.53
IELTSWritingChecker.org
0.57
ChatGPT
0.88
Engnovate
0.94
Writing9
1.72

误差在 0.5 分以内

越高越好
IELTS Writing Practice
74.2% · 72/97
IELTSWritingChecker.org
70.1% · 68/97
ChatGPT
46.4% · 45/97
Engnovate
39.2% · 38/97
Writing9
19.6% · 19/97

误差在 1.0 分以内

越高越好
IELTS Writing Practice
93.8% · 91/97
IELTSWritingChecker.org
86.6% · 84/97
ChatGPT
76.3% · 74/97
Engnovate
73.2% · 71/97
Writing9
35.1% · 34/97

带符号偏差

越接近零越好

带符号偏差是带符号误差的平均值。负值表示该平台的平均评分低于官方分数。

IELTS Writing Practice
-0.27
IELTSWritingChecker.org
-0.38
ChatGPT
-0.85
Engnovate
-0.86
Writing9
-1.58

如何解读整体结果

上面四张图表将每个平台的评分与公布的官方分数进行比较。解读方法如下。

  • MAE(平均绝对误差)是平台评分与官方分数之间的平均差距。越低越好。
  • 误差在 0.5 分以内和误差在 1 分以内表示评分与官方分数的差距不超过该数值的频率。越高越好。
  • 带符号偏差表示平台评分通常高于还是低于官方分数。越接近零越好,负值表示平均评分偏低。

例如,IELTSWritingChecker.org 有31次完全一致,IELTS Writing Practice 为28次。完全一致仍然重要,但 IELTS Writing Practice 误差超过 1 分的情况有6次,而 IELTSWritingChecker.org 有13次;误差超过 1 分的情况越少,日常使用中出现大幅偏离的情况就越少。

平均绝对误差(分)

小作文(Task 1)与大作文(Task 2)

全部五个平台按任务类型划分的平均绝对误差,其中小作文(Task 1)51篇,大作文(Task 2)46篇。图表中误差指标保留两位小数,数值越低越好。

越低越好

小作文(Task 1)

n = 51
IELTS Writing Practice
0.42
IELTSWritingChecker.org
0.45
ChatGPT
0.77
Engnovate
0.75
Writing9
1.51

大作文(Task 2)

n = 46
IELTS Writing Practice
0.65
IELTSWritingChecker.org
0.70
ChatGPT
0.99
Engnovate
1.14
Writing9
1.96

按任务拆分的结果

按任务类型拆分97篇作文,得到小作文(Task 1)51篇、大作文(Task 2)46篇。各任务的平均绝对误差如下:

  • 小作文:IELTS Writing Practice 0.42;IELTSWritingChecker.org 0.45;ChatGPT 0.77;Engnovate 0.75;Writing9 1.51。
  • 大作文:IELTS Writing Practice 0.65;IELTSWritingChecker.org 0.70;ChatGPT 0.99;Engnovate 1.14;Writing9 1.96。

IELTS Writing Practice 在两类任务上的 MAE 均为最低。在本样本中,所观察的全部五个工作流程的大作文 MAE 都高于小作文 MAE。基准测试无法说明原因;它只记录这一规律,并未测量其成因,我们也不做推测。

关于 Writing9,有一项预处理说明。它被观察到的公开工作流程不接受A类小作文的图片,本测试按该产品的实际运行情况对其进行评估。当 Writing9 显示 <4 时,按预先声明的基准测试约定,在计算误差之前将其记为3.5,即所显示的“低于 4”区间的上限。没有任何结果被排除:五个平台在两个任务子集上都有完整结果。

来自剑桥雅思 20 和 21 的32篇作文

近期剑桥真题压力测试

剑桥雅思 20 和 21 子集(32篇作文)的结果。误差指标保留两位小数,百分比保留一位小数,次数为精确值。

分数误差

平均绝对误差

越低越好
IELTS Writing Practice
0.55
IELTSWritingChecker.org
0.69
ChatGPT
0.92
Engnovate
1.02
Writing9
2.05

误差在 0.5 分以内

越高越好
IELTS Writing Practice
71.9% · 23/32
IELTSWritingChecker.org
62.5% · 20/32
ChatGPT
43.8% · 14/32
Engnovate
40.6% · 13/32
Writing9
6.3% · 2/32

误差在 1.0 分以内

越高越好
IELTS Writing Practice
93.8% · 30/32
IELTSWritingChecker.org
81.3% · 26/32
ChatGPT
71.9% · 23/32
Engnovate
62.5% · 20/32
Writing9
15.6% · 5/32

带符号偏差

越接近零越好

带符号偏差是带符号误差的平均值。负值表示该平台的平均评分低于官方分数。

IELTS Writing Practice
-0.39
IELTSWritingChecker.org
-0.56
ChatGPT
-0.92
Engnovate
-0.89
Writing9
-2.02

近期剑桥真题测试能说明什么

较早的雅思作文可能已经出现在模型训练数据中,这可能让模型在熟悉材料上的结果显得更好。剑桥雅思 20 和 21 是本数据集中最新的两本书。单独测试其中的32篇作文可以降低这一风险,因此这是最值得关注的子集。

IELTS Writing Practice 在全部四项指标上依然领先:MAE 为0.55,71.9%的评分误差在 0.5 分以内,93.8%在 1 分以内,带符号偏差为-0.39。因此,这一领先在较新的材料上同样成立,而不只体现在完整数据集上。

这项测试无法证明没有任何模型见过这些作文,因为模型提供商不会公开完整的训练数据。它是一项更严格的检验,而不是保证。

97篇作文

97篇作文数据集

97篇作文基准测试中的每个来源及其数量,以及小作文(Task 1)/大作文(Task 2)和学术类/培训类的合计。数量均为精确值。

小作文(Task 1):51篇

大作文(Task 2):46篇

学术类:54篇

培训类:43篇

  1. IELTS.org 学术类范文(2023)12
  2. IELTS.org 培训类范文(2023)11
  3. IELTS.org 学术类机考范文4
  4. 《雅思官方练习材料》第1卷10
  5. 《雅思官方练习材料》第2卷10
  6. 剑桥雅思 18 学术类2
  7. 剑桥雅思 19 学术类8
  8. 剑桥雅思 19 培训类8
  9. 剑桥雅思 20 学术类8
  10. 剑桥雅思 20 培训类8
  11. 剑桥雅思 21 学术类8
  12. 剑桥雅思 21 培训类8

方法、局限与来源

参照标准。 97篇作文中的每一篇都有公布的官方总分。本基准测试只使用公布的官方总分作为参照分数。本研究不对各评分项层面的参照分数作任何声明,也不从任何方向评估各评分项分数。

指标。 纯文本公式:带符号误差 = 平台分数减去公布的官方分数。MAE = 带符号误差绝对值的平均值。带符号偏差 = 带符号误差的平均值。“0.5 分以内”和“1.0 分以内”是包含边界值的阈值计数;完全一致指绝对误差为零。图表中误差指标保留两位小数,百分比保留一位小数,次数为精确值。所展示的每个数字都基于全精度的基准测试数值,例如 IELTS Writing Practice 在完整数据集上的平均绝对误差为0.5309。

数据集。 97篇作文包括:IELTS.org 学术类范文(2023):12;IELTS.org 培训类范文(2023):11;IELTS.org 学术类机考范文:4;《雅思官方练习材料》第1卷:10;《雅思官方练习材料》第2卷:10;剑桥雅思 18 学术类:2;剑桥雅思 19 学术类:8;剑桥雅思 19 培训类:8;剑桥雅思 20 学术类:8;剑桥雅思 20 培训类:8;剑桥雅思 21 学术类:8;剑桥雅思 21 培训类:8。合计:97。小作文(Task 1):51。大作文(Task 2):46。学术类:54。培训类:43。剑桥雅思 18 只提供学术类作文。

局限。 Writing9 被观察到的公开工作流程不接受A类小作文的图片;当它显示 <4 时,按预先声明的基准测试约定记为3.5,即所显示的“低于 4”区间的上限。五个平台在完整的 n=97 数据集和近期的 n=32 子集上都有完整结果,两个数据集中均无缺失结果。自动评分是估算,不是雅思官方成绩。逐篇的原始平台评分表、反馈与批改记录、批注以及内部模型数据均以非公开方式保留,不予发布;官方来源作文本身是其出版方公开发布的材料,并非保密内容。

相关的已发布对比。 如需了解相关的已发布对比,请参阅IELTSWritingChecker.org 的准确度研究和其关于用 ChatGPT 评估雅思写作的分析。

雅思官方资源。 如需官方评分指导和写作备考材料,请参阅IELTS.org 关于设定雅思分数要求的资源和IELTS.org 的写作考试资源。

为你自己的作文获取估算分数和诊断性批改

检查你自己的作文

邀请你试用现有的 IELTS Writing Practice 评分模拟器,它会给出估算分数和诊断性批改。它不提供雅思官方成绩。

已加载题目:大作文。
第2部分

建议用时约 40 分钟,至少写 250 词。

词数:040:00 输入第一个词后开始计时