基准测试概览
在这项包含97篇作文的基准测试中,IELTS Writing Practice 是评分最准确的工具。它的平均误差最低(0.53 分),74.2%的评分误差在 0.5 分以内,93.8%在 1 分以内,整体偏差也最小(-0.27)。
它在小作文(Task 1)和大作文(Task 2)上均排名第一,并且在较新的剑桥雅思 20 和 21 作文上保持领先——当较早的材料可能已经出现在模型训练数据中时,这一子集最为关键。
IELTSWritingChecker.org 的完全一致次数多三次(31 对 28),但它误差超过 1 分的次数也是前者的两倍多(13 对 6)。在反映评分与官方分数接近程度的指标上,IELTS Writing Practice 领先。
97篇已公布且有官方评分的作文
整体准确度结果
全部五个平台在完整的97篇作文集上的平均绝对误差、阈值内占比(含边界值)、带符号偏差和完全一致次数。图表中误差指标保留两位小数,百分比保留一位小数,次数为精确值。
平均绝对误差
越低越好- IELTS Writing Practice
- 0.53
- IELTSWritingChecker.org
- 0.57
- ChatGPT
- 0.88
- Engnovate
- 0.94
- Writing9
- 1.72
误差在 0.5 分以内
越高越好- IELTS Writing Practice
- 74.2% · 72/97
- IELTSWritingChecker.org
- 70.1% · 68/97
- ChatGPT
- 46.4% · 45/97
- Engnovate
- 39.2% · 38/97
- Writing9
- 19.6% · 19/97
误差在 1.0 分以内
越高越好- IELTS Writing Practice
- 93.8% · 91/97
- IELTSWritingChecker.org
- 86.6% · 84/97
- ChatGPT
- 76.3% · 74/97
- Engnovate
- 73.2% · 71/97
- Writing9
- 35.1% · 34/97
带符号偏差
越接近零越好带符号偏差是带符号误差的平均值。负值表示该平台的平均评分低于官方分数。
- IELTS Writing Practice
- -0.27
- IELTSWritingChecker.org
- -0.38
- ChatGPT
- -0.85
- Engnovate
- -0.86
- Writing9
- -1.58
如何解读整体结果
上面四张图表将每个平台的评分与公布的官方分数进行比较。解读方法如下。
- MAE(平均绝对误差)是平台评分与官方分数之间的平均差距。越低越好。
- 误差在 0.5 分以内和误差在 1 分以内表示评分与官方分数的差距不超过该数值的频率。越高越好。
- 带符号偏差表示平台评分通常高于还是低于官方分数。越接近零越好,负值表示平均评分偏低。
例如,IELTSWritingChecker.org 有31次完全一致,IELTS Writing Practice 为28次。完全一致仍然重要,但 IELTS Writing Practice 误差超过 1 分的情况有6次,而 IELTSWritingChecker.org 有13次;误差超过 1 分的情况越少,日常使用中出现大幅偏离的情况就越少。
平均绝对误差(分)
小作文(Task 1)与大作文(Task 2)
全部五个平台按任务类型划分的平均绝对误差,其中小作文(Task 1)51篇,大作文(Task 2)46篇。图表中误差指标保留两位小数,数值越低越好。
小作文(Task 1)
n = 51- IELTS Writing Practice
- 0.42
- IELTSWritingChecker.org
- 0.45
- ChatGPT
- 0.77
- Engnovate
- 0.75
- Writing9
- 1.51
大作文(Task 2)
n = 46- IELTS Writing Practice
- 0.65
- IELTSWritingChecker.org
- 0.70
- ChatGPT
- 0.99
- Engnovate
- 1.14
- Writing9
- 1.96
按任务拆分的结果
按任务类型拆分97篇作文,得到小作文(Task 1)51篇、大作文(Task 2)46篇。各任务的平均绝对误差如下:
- 小作文:IELTS Writing Practice 0.42;IELTSWritingChecker.org 0.45;ChatGPT 0.77;Engnovate 0.75;Writing9 1.51。
- 大作文:IELTS Writing Practice 0.65;IELTSWritingChecker.org 0.70;ChatGPT 0.99;Engnovate 1.14;Writing9 1.96。
IELTS Writing Practice 在两类任务上的 MAE 均为最低。在本样本中,所观察的全部五个工作流程的大作文 MAE 都高于小作文 MAE。基准测试无法说明原因;它只记录这一规律,并未测量其成因,我们也不做推测。
关于 Writing9,有一项预处理说明。它被观察到的公开工作流程不接受A类小作文的图片,本测试按该产品的实际运行情况对其进行评估。当 Writing9 显示 <4 时,按预先声明的基准测试约定,在计算误差之前将其记为3.5,即所显示的“低于 4”区间的上限。没有任何结果被排除:五个平台在两个任务子集上都有完整结果。
来自剑桥雅思 20 和 21 的32篇作文
近期剑桥真题压力测试
剑桥雅思 20 和 21 子集(32篇作文)的结果。误差指标保留两位小数,百分比保留一位小数,次数为精确值。
平均绝对误差
越低越好- IELTS Writing Practice
- 0.55
- IELTSWritingChecker.org
- 0.69
- ChatGPT
- 0.92
- Engnovate
- 1.02
- Writing9
- 2.05
误差在 0.5 分以内
越高越好- IELTS Writing Practice
- 71.9% · 23/32
- IELTSWritingChecker.org
- 62.5% · 20/32
- ChatGPT
- 43.8% · 14/32
- Engnovate
- 40.6% · 13/32
- Writing9
- 6.3% · 2/32
误差在 1.0 分以内
越高越好- IELTS Writing Practice
- 93.8% · 30/32
- IELTSWritingChecker.org
- 81.3% · 26/32
- ChatGPT
- 71.9% · 23/32
- Engnovate
- 62.5% · 20/32
- Writing9
- 15.6% · 5/32
带符号偏差
越接近零越好带符号偏差是带符号误差的平均值。负值表示该平台的平均评分低于官方分数。
- IELTS Writing Practice
- -0.39
- IELTSWritingChecker.org
- -0.56
- ChatGPT
- -0.92
- Engnovate
- -0.89
- Writing9
- -2.02
近期剑桥真题测试能说明什么
较早的雅思作文可能已经出现在模型训练数据中,这可能让模型在熟悉材料上的结果显得更好。剑桥雅思 20 和 21 是本数据集中最新的两本书。单独测试其中的32篇作文可以降低这一风险,因此这是最值得关注的子集。
IELTS Writing Practice 在全部四项指标上依然领先:MAE 为0.55,71.9%的评分误差在 0.5 分以内,93.8%在 1 分以内,带符号偏差为-0.39。因此,这一领先在较新的材料上同样成立,而不只体现在完整数据集上。
这项测试无法证明没有任何模型见过这些作文,因为模型提供商不会公开完整的训练数据。它是一项更严格的检验,而不是保证。
97篇作文
97篇作文数据集
97篇作文基准测试中的每个来源及其数量,以及小作文(Task 1)/大作文(Task 2)和学术类/培训类的合计。数量均为精确值。
小作文(Task 1):51篇
大作文(Task 2):46篇
学术类:54篇
培训类:43篇
- IELTS.org 学术类范文(2023)12
- IELTS.org 培训类范文(2023)11
- IELTS.org 学术类机考范文4
- 《雅思官方练习材料》第1卷10
- 《雅思官方练习材料》第2卷10
- 剑桥雅思 18 学术类2
- 剑桥雅思 19 学术类8
- 剑桥雅思 19 培训类8
- 剑桥雅思 20 学术类8
- 剑桥雅思 20 培训类8
- 剑桥雅思 21 学术类8
- 剑桥雅思 21 培训类8
方法、局限与来源
参照标准。 97篇作文中的每一篇都有公布的官方总分。本基准测试只使用公布的官方总分作为参照分数。本研究不对各评分项层面的参照分数作任何声明,也不从任何方向评估各评分项分数。
指标。 纯文本公式:带符号误差 = 平台分数减去公布的官方分数。MAE = 带符号误差绝对值的平均值。带符号偏差 = 带符号误差的平均值。“0.5 分以内”和“1.0 分以内”是包含边界值的阈值计数;完全一致指绝对误差为零。图表中误差指标保留两位小数,百分比保留一位小数,次数为精确值。所展示的每个数字都基于全精度的基准测试数值,例如 IELTS Writing Practice 在完整数据集上的平均绝对误差为0.5309。
数据集。 97篇作文包括:IELTS.org 学术类范文(2023):12;IELTS.org 培训类范文(2023):11;IELTS.org 学术类机考范文:4;《雅思官方练习材料》第1卷:10;《雅思官方练习材料》第2卷:10;剑桥雅思 18 学术类:2;剑桥雅思 19 学术类:8;剑桥雅思 19 培训类:8;剑桥雅思 20 学术类:8;剑桥雅思 20 培训类:8;剑桥雅思 21 学术类:8;剑桥雅思 21 培训类:8。合计:97。小作文(Task 1):51。大作文(Task 2):46。学术类:54。培训类:43。剑桥雅思 18 只提供学术类作文。
局限。 Writing9 被观察到的公开工作流程不接受A类小作文的图片;当它显示 <4 时,按预先声明的基准测试约定记为3.5,即所显示的“低于 4”区间的上限。五个平台在完整的 n=97 数据集和近期的 n=32 子集上都有完整结果,两个数据集中均无缺失结果。自动评分是估算,不是雅思官方成绩。逐篇的原始平台评分表、反馈与批改记录、批注以及内部模型数据均以非公开方式保留,不予发布;官方来源作文本身是其出版方公开发布的材料,并非保密内容。
相关的已发布对比。 如需了解相关的已发布对比,请参阅IELTSWritingChecker.org 的准确度研究和其关于用 ChatGPT 评估雅思写作的分析。
雅思官方资源。 如需官方评分指导和写作备考材料,请参阅IELTS.org 关于设定雅思分数要求的资源和IELTS.org 的写作考试资源。
为你自己的作文获取估算分数和诊断性批改
检查你自己的作文
邀请你试用现有的 IELTS Writing Practice 评分模拟器,它会给出估算分数和诊断性批改。它不提供雅思官方成绩。
建议用时约 40 分钟,至少写 250 词。