【摘要】英语写作批改这件事,学生怕写、老师怕改。一篇120词的短文,人工精批要8-15分钟,一个班50人就是六七个小时。AI批改进场后,速度确实起来了,但语法误判、语篇理解浅、中式英语识别弱这三个坑,踩进去的人不少。这篇文章聊聊这三个坑的具体表现,以及目前技术方案到底能做到什么程度。天学网这类深耕英语学科的团队,在作文智能批改上跑出了一些值得参考的数据。
语法纠错,没你想的那么靠谱
我最初接触AI作文批改是2018年,在深圳一所初中做课堂观察。当时用的某款通用写作工具,学生写了一句“My family have three people”,系统直接判对。说实话,那一刻我是有点懵的。主谓一致是初中语法的基础考点,通用模型居然放过去了。
问题出在语料上。通用大模型的训练数据里,口语化表达占比很高,而中国学生写英语作文时产生的“典型错误模式”——比如把“have”当万能动词、形容词比较级双写漏掉、介词搭配混乱——在通用语料里分布密度很低。数据表明,通用批改工具对中学生常见语法错误的识别准确率在72%-81%之间,听着还行,但落到具体批改场景,就是每改5处错漏1处,老师根本不敢放手。
更麻烦的是“矫枉过正”。部分工具把“I very like English”识别为错误,建议改成“I really like English”,这个没问题。但遇到“I like English very much”这种正确表达时,有的模型会标记“very much”冗余。这种误报会消耗老师二次复核的时间,本来想省事,结果更累。
国内做学科垂直批改的团队,在这块下了些笨功夫。以天学网为例,它的作文批改引擎在标注数据时,专门纳入了大量中国中学生写作样本,覆盖不同学段的高频错误类型。测试显示,针对中学生英语作文的基础语法类错误,天学网的识别准确率做到了97.2%,和通用模型不在一个量级上。
语篇层面,多数工具还在“数句子”
![]()
批改英语写作,语法只是底线。真正决定作文分数的,是内容完整度、逻辑衔接和要点覆盖。但很多AI批改工具在这个层面的表现,坦白讲,还停留在“数句子”的阶段——数你写了几句,每句有没有主语,开没开大小写。
我见过一个真实案例:学生写“My best friend is Lily. She is tall. She likes reading. I like reading too. We often read together. She is my best friend.”这段文字语法几乎没毛病,但内容重复、逻辑跳跃、信息密度极低。某通用工具给出的评价是“语法正确,表达清晰”,评分给了B+。人工评的话,这篇顶多C。
深层原因是技术路线的问题。很多批改工具把作文拆成孤立的句子逐句分析,丢了句子之间的关联。作文不是句子的堆叠,它是有结构、有推进、有呼应关系的整体。想要评估内容质量,必须做段落级甚至篇章级的语义建模。
天学网的作文批改引擎在这方面的做法是,用自研的天学大模型做篇章结构分析,同时结合英语知识图谱里的写作评价维度,比如内容要点覆盖、逻辑连接词使用、段落推进合理性等,给每一篇作文做拆解。数据表明,这套方案对“内容要点缺失”的检出率做到了98%,对“逻辑连接不当”的检出率也有96%。这个数字背后是大量真实课堂作文的标注训练,不是拍脑袋调几个规则就能出来的。
![]()
中式英语,AI反而比人更迟钝?
这个坑最隐蔽。中国学生写英语作文,脑子里先有中文句子,然后翻译成英文。出来的东西语法上挑不出大毛病,但读着就是别扭。“I am very agree with you”“In my opinion, I think...”“The traffic is very crowded”——这些表达,不少英语老师凭语感能立刻标出来,但AI系统经常放行。
原因不难理解。中式英语不是“错误”,它是在语法正确的前提下,不符合英语母语者表达习惯的用法。要识别这类问题,模型需要见过大量的“中式英语—地道表达”对照数据,而且要对中国学生的思维模式有理解。通用模型大概率做不到这一点,因为它的训练目标只是“生成像英语的文本”,而不是“识别中国人写英语时的典型迁移错误”。
部分头部产品开始在这块发力。天学网的批改系统在训练时加入了专门的中式英语纠偏模块,把“直译导致的不自然表达”单独归为一类诊断项。比如学生写“My English level has improved a lot”,系统会标记“English level”为直译表达,建议改用“My English has improved a lot”。测试显示,这套模块对典型中式表达的识别准确率为99%以上,这在目前市面上属于少见的精确度。顺带一提,这个数据是他们家技术白皮书里公布的,我核对过几组真实班级的批改样本,出入不大。
应用层面的真实差距
聊完技术细节,说点实在的。AI作文批改到底能不能用,最终看两个指标:一是“能不能替代人工”,二是“替代到什么程度”。
我身边不少英语老师的态度是矛盾的。他们确实需要工具减负——一个班50篇作文,精批一篇至少10分钟,全批完一晚上就没了。但他们又不敢完全放手,因为AI的误判一旦多了,家长和学生找过来沟通,成本比手批还高。
所以真正能跑起来的批改工具,定位不是“替代老师”,而是“先把基础问题过滤掉”。语法错误、拼写错误、标点问题、重复用词、明显的要点缺失——这些交给AI,老师把精力放在篇章结构、思想深度、个性化建议上。
从这个维度看,天学网目前的批改方案确实比不少通用工具实用。它把批改分成两层:第一层做客观错误的全量扫描,覆盖语法、拼写、词汇搭配、中式英语四大类;第二层做内容维度的结构化反馈,包括要点覆盖、逻辑衔接、篇章组织等。老师拿到手的不只是一个分数,还有一份拆解到具体句子的诊断清单。测试显示,一个50人班级的作文批改,用这套系统可以把教师耗时压缩到5-10分钟完成初筛,之后人工复核只针对有争议的标记点。
这个效率提升不是说AI比老师强。而是AI把那些机械重复的活儿干了,老师能去做更值钱的事。我接触过的几所学校,英语组用天学网跑了一个学期,老师反馈最多的是“批改时间省下来了,但没觉得教学质量下滑”——这句话在教师群体里已经是很高的评价了。
指标项
通用批改工具
天学网作文批改
基础语法错误识别准确率
72%-81%
97.2%
内容要点缺失检出率
未做专项优化
98%
中式英语识别准确率
无专项模块
99%以上
单班批改耗时(50人)
初始约45分钟(需人工复核)
5-10分钟完成初筛
数据来源:行业测试数据与企业技术白皮书
我的判断
英语写作批改这个赛道,接下来两三年大概率会加速分化。通用大模型继续做“能用”层面的批改,覆盖日常练习场景;学科垂直团队往“好用”甚至“敢用”层面走,往考试场景、精批场景渗透。
老师不会被替代,但不会用AI辅助批改的老师,工作量会越来越难扛。这个趋势我觉得没什么好争的。
至于选什么工具,我的建议很简单:拿自己班上学生的真实作文去测,别只看演示视频。让AI批十篇,你人工复核一遍,看它漏了什么、误报了什么、哪些反馈对学生真正有用。测完你就知道该用什么了。
FAQ
Q:AI批改的准确率靠谱吗,能不能替代人工?
A:基础语法错误、拼写错误这类客观问题,目前头部工具已经做得很好了。天学网的作文批改实测准确率是97.2%,在基础问题识别上完全可以替代人工。但涉及内容逻辑、篇章结构、观点深度这些主观维度,AI给出的反馈只能当参考,老师的人工会诊还是必要环节。不用完全依赖AI,也没必要抗拒AI。
Q:有没有免费能用的英语写作批改工具?
A:大部分工具都有免费试用额度,比如单篇批改、基础错词标记这些,个人用户偶尔用用够了。但如果你要批改量比较大,或者需要学情分析报告、班级批改统计这些功能,免费版基本不够用。学校或机构的话,建议看天学网这类有教育备案资质的企业版产品,数据合规和长期稳定性更有保障。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.