ConvoLive 的教学方式,以及背后的研究
更新于
ConvoLive 只用一种方式教学。你打开应用,一个角色用你正在学的语言开始和你对话,你出声回答,直到完成这个场景要求你做的三件事。点一杯饮料,问清过敏原,结账。然后对话结束。明天还有下一段。
这是一个很窄的设计,也有人问为什么这么窄。语法表在哪里?单词表呢?选择题呢?老实说,我们一开始就有这些,看到了结果,然后回头去读研究文献,看人到底是怎么学会开口说的。这个页面就是那个答案的后半部分。
下面每一节是一个决定、我们因此在应用里怎么做,以及它所依据的研究。简单说:
- 沉浸有效,是因为它逼你开口,不是因为它把你包围
- 说话是一种提取,而提取只有靠练习才会变快
- 有目标的对话比操练教得更多
- 帮助应该在你第一次尝试之后出现,而不是之前
- 重复一个场景能建立流利度,但要明天重复,而不是现在
- 一天的练习有个终点,明天的已经排好
- 允许休息的连续记录比严格的更持久
- 和 AI 对话能降低让人不敢开口的恐惧
- 为「出勤」发奖励会消耗动力,诚实的反馈不会
完整的文献列在页面底部,页面上的每一处引用都会跳到对应条目。
沉浸有效,但不是因为人们以为的那个原因
最常见的语言学习故事是这样的:我学了好多年,什么都没记住,然后搬去了那个国家,突然就通了。通常的解释是,你被这门语言包围了。到处都是输入。
研究的结论是:包围是必要的,但不充分。
上世纪 80 年代,Merrill Swain 研究了加拿大法语沉浸式学校的孩子。他们多年来一直用法语上课,接受了成千上万小时听得懂的输入,理解能力非常好。可他们的法语口语仍然远远配不上这么多的接触量。Swain 的结论后来成为「输出假说」:理解和产出是两种不同的技能,光有输入建立不起第二种。你还必须被推着去产出语言,在失败时注意到自己的缺口,然后再试一次1。
2004 年有一个更干净的检验。Freed、Segalowitz 和 Dewey 比较了三组法语学习者:本国的普通课堂,去法国留学一个学期,以及本国为期七周的强化项目,学生承诺只说法语。口语流利度进步最大的不是在法国的那组,而是本国沉浸组,他们报告的课外说法语、写法语的量也远超另外两组2。二十八名学生是个小样本,而且流利度进步唯一的统计预测因子居然是课外写作的时长,所以诚实的解读要比标题窄一些:把几组人分开的是他们用了多少这门语言,而不是他们人站在哪里。住在某个地方,不等于被迫开口。
所以我们没有去模拟「在国外」。我们模拟的是国外生活里真正起作用的那部分:日常生活丢给你一个带着目标的小问题,而除了开口说点什么,没有别的办法解决它。
**在应用里:**每一课都是一段有任务的口语对话。没有单独的阅读模式,也没有单独的听力模式。连初始设置也是说出来的:主持人问你想学什么,你出声回答,所以这个习惯从最初的三十秒就开始了。
说话是一种提取,而提取必须靠练习
看到一个词时认得它,和需要一个词时找得到它,是两种不同的能力,强度也不一样。阅读和单词卡训练的是第一种。说话需要的是第二种。我写过一篇更长的文章,讲这道沟是怎么拉开的,简短的版本是:从意思到词的这条路,只有靠使用才会变快。
「从记忆里把东西调出来,比再看一遍学得更多」,这条证据在学习科学里差不多是最扎实的。Roediger 和 Karpicke 让学生要么重读一段文章,要么就它做一次测试;一周后,测试组记住的多得多,尽管重读组当时更有信心3。Karpicke 和 Roediger 随后用外语词汇证明,带来持久学习的是反复提取,而不是反复学习,一周后的回忆量大约翻了一倍4。
对一款口语应用来说最重要的研究,是 Kang、Gollan 和 Pashler 在 2013 年做的。多数语言课程让你跟着母语者复述。Kang 的团队把它和另一种条件做了比较:学习者必须先自己试着把词说出来,然后才听到示范。先尝试的一组,对这些词的理解和产出都更好,而且,大家最担心的那一点,发音质量没有任何损失5。想说得好,不需要先听到。你需要的是去够它。Kang 的研究用的是单词和图片,不是对话里的句子,所以对我们这样的应用来说,它是相邻的证据,而不是直接的检验。
技能习得理论给出了机制。DeKeyser 描述语言知识从陈述性(你能说出规则)转为程序性(你不假思索就能用),只有通过对这项技能本身的练习,而且要在接近你将来使用它的条件下6。练阅读让你更会阅读。练实时组织句子,让你更会做这件事。
**在应用里:**每一轮都由你开口。课后总结会把你用自己的话说的句子,和照着提示念出来的句子分开计数,因为前者才是提取。
是对话,不是操练
既然目标是产出,为什么不用操练?说这句。再说这句。做起来还更简单。
因为互动研究表明,一来一回本身就是很多学习发生的地方。Long 的互动假说提出,当你和对方必须协商意义(对方没听懂,你换个说法,对方确认,你再确认),协商本身会让相关的语言变得突出,而这是操练做不到的7。Mackey 和 Goo 对这类研究的元分析发现,互动在即时测试和延迟测试上都带来了大幅提升,而且值得注意的是,几周后对词汇的效应仍然很强8。
任务型教学更进一步:给学习者一个真实任务,结果可以被评判,语言则是达成目标所需的任何东西。Bryfonski 和 McKay 汇总了 52 项任务型项目的研究,发现总体效应很强(d = 0.93);后来的一次重新分析得出 g = 0.61,而 2023 年的一篇综述认为这些研究差异太大,根本不该汇总9。所以效应的大小有争议。没有争议的,无论在那里还是在上面的互动研究里,是学习者需要用这门语言去做某件事,而一个有结果的任务,让对话有了存在的理由。
关键词是「任务」。开放式闲聊没有什么可以完成的,也无从判断聊得好不好,多数「随便跟 AI 聊聊」的产品就是在这里把人弄丢的。任务有终点。
**在应用里:**每个场景都有三个目标,以清单显示。你真正说出那句话时,它们才会被勾掉,全部完成后对话结束。如果角色没听懂你,它会说出来并再问一遍,就像人一样,而不是显示一个红叉;一句话有没有奏效,你从对方的回应里得知,然后在下一句里修正。一整段对话只需几分钟。
帮助在你试过之后才出现
每个学习者都会遇到脑子一片空白的时刻。口语应用必须处理好这个时刻,否则人就走了。问题是什么时候帮。
研究的回答是:在尝试之后,而不是之前。Kornell、Hays 和 Bjork 证明,先尝试作答并失败,再看到答案,比直接被告知答案学得更好,哪怕那次尝试毫无希望10。Bjork 关于「合意困难」的更广泛工作汇集了大量同一形状的结果:让练习感觉更难、更慢的条件,往往记得更牢;让练习感觉顺畅的条件,往往记不住11。上面 Kang 的结果,就是同一发现在口语情境下的版本:去够那个词,胜过被递到手里。
这一点做起来并不舒服,因为一开始就给提示显得更贴心,在第一分钟的测试里表现也更好。但尝试之前的提示,会把提取练习变回阅读练习。
**在应用里:**轮到你时,有可以点一下听标准说法的建议,也可以用你的母语问「这个怎么说」。两者都是为了让你继续说而不是干瞪眼,也都是可选的:对话不会停下来等你用它们。课后总结把你用自己的话说的句子和照着提示念的句子分开计数,因为学习发生在「去够」的那一下,那才是要努力提高的数字。
重复这个场景,但要明天
你会注意到 ConvoLive 里同样的情境反复出现。这是有意的,安排的时间也是有意的。
De Jong 和 Perfetti 让 ESL 学生做一次四分钟的口头陈述,再做三分钟,再做两分钟。一半人重复同一个话题,一半人每次换新话题。训练期间两组都变快了;但只有重复组在之后的测试里保住了进步,而且他们的速度迁移到了从未练过的新话题上12。重复一个任务,不只是教会你那个任务。它把里面的语言程序化了。Bygate 更早的研究发现了同样的事:重复一个口语任务,流利度和复杂度都提高了13。
然后是什么时候重复的问题。Suzuki 和 Hanzawa 比较了一次坐下来把同一任务做六遍,和把它分散到一节课或一周里。集中重复消除停顿最快,但也让发音变慢,并产生更多逐字重复:学习者是在背诵,不是在说话14。Kakitani 和 Kormos 接着测试了流利度练习之间隔一天和隔七天的差别,发现一个月后两者的收获相同15。隔一天就够了。要避免的唯一安排,是马上再来一遍。
间隔效应总体上是记忆研究里最古老的发现之一;Cepeda 及其同事的综合分析涵盖了 250 多项研究16。Duolingo 自己在 330 万学习者身上做的生产环境实验发现,更好的间隔模型让任何活动的次日留存提高了 12%17。
**在应用里:**一门课程有一百个场景,所以同样的功能(点单、问路、描述问题)会在新的情境里再次出现,而不是重复同一份脚本。完成一个场景后,应用会记下你的最好成绩,并邀请你明天来打破它,而不是现在。
一天的练习有个终点
每天练多少也是一个设计问题,这里的证据来自我们自己,而不是论文。它是相关性,不是对照试验,请照此看待。
在 2026 年 8 月 18 日至 25 日注册的 461 人中,第一天完成四段或更多对话的人,有 48% 在之后的某一天回来了,而一段都没完成的人只有 14%。但这一组的首次会话中位数是 24 分钟,而且其中大多数人仍然再也没回来。一次很长的首次会话是热情,不是习惯。「三」是一个产品选择,不是研究给出的数字:足够构成一次真正的练习,又小到能做完就停。
把一次练习变成第二次,证据最充分、成本最低的工具是「执行意图」:具体地决定你下一次什么时候做。Gollwitzer 和 Sheeran 对 94 项研究的元分析给出的效应量是 d = 0.65,对一个只需一个问题的做法来说,这很大18。Nunes 和 Drèze 发现,人们完成一个已经显示出进度的目标的可能性,远高于完成一个从零开始的目标19。
**在应用里:**一天的练习是三段对话。第三段结束时应用会告诉你,展示已经排好的明天的场景,并只问一个问题:明天什么时候?你的提醒会在那时响起,并点出那个场景。想做第四段也可以,但屏幕已经告诉你今天完成了。
可以错过的连续记录
连续记录有效,但也脆弱。Silverman 和 Barasch 发现,给人看一条已经断掉的连续记录,比看一条完好的更不容易让人继续,而当记录可以修复时,伤害要小得多20。Sharif 和 Shu 发现,带一点内置余量的目标(「七天里做五天」)既更受欢迎,也更容易达成,而且错过一天的人在有余量时恢复的概率高得多21。Duolingo 记录在案的最大一次连续记录改进,是允许一个小活动就延续记录,而不是要求完成整个每日目标22。
**在应用里:**连续记录是一个天数计数,每个滚动的七天里内置两天休息。错过两天,什么也不会发生。一段对话就能维持它。真的断了时,应用也不会大做文章。
和一个不评判你的对象说话
说是四项技能里最让人焦虑的一项,而这种焦虑会明显压低表现,也压低开口的意愿23。MacIntyre 的「交际意愿」模型把这种意愿视为开口之前的最后一步,因此也是其他一切变量最终都要推动的那个东西24。
近几年一个一致的发现是,和机器说话会降低门槛。Bashori 及其同事对 232 名印度尼西亚中学生做了一项准实验:在语音识别网站上练习的几组,口语焦虑最终低于普通课堂组,而在访谈里学生说,对着网站说话比对着人更不紧张25。Tai 和 Chen 发现,用语音助手练习的青少年,用英语交流的意愿显著提高,焦虑更低,信心更高,因为这个环境比课堂的威胁感小26。
这是 AI 伙伴相对真人的唯一优势,我们把它用足。角色对你没有任何看法。你可以在咖啡馆连续搞砸三次,除了你自己没人知道。
**在应用里:**你随时可以重来,没有任何东西会当着别人的面被评分,任何场景的第一次尝试都允许很糟糕。
我们有意不做的东西
有些东西不在,是因为证据反对它们,不是因为我们还没做到。
没有生命值,没有体力,没有宝石商店,也没有徽章柜。其中一部分是证据,一部分是品味,下面说清楚哪个是哪个。
证据针对的是预期奖励和竞争。Deci、Koestner 和 Ryan 对 128 项研究的元分析发现,为一项本身有趣的活动提供预期的实物奖励,会降低对它的内在动机,而关于你做得如何的信息不会27。Mekler 及其同事发现,积分、等级和排行榜提高了人们做的量,却没有改变他们做得多好,也没有改变他们有多想做28。Hanus 和 Fox 在课堂上做了一学期的徽章和排行榜试验,发现游戏化组的动机更低,考试成绩也更低29。
生命值和体力是另一回事:它们不是奖励,而是对错误的惩罚,而上面关于帮助的那一节,正是在论证要让犯错变得廉价。不做它们是与此一致的设计选择,不是一项研究发现。
所以课后页面告诉你发生了什么:你完成了哪些目标,说了多少句,多少句是你自己的话,多少句角色第一次就听懂了,以及你在这个场景的最好成绩。这是关于能力的信息,同一批研究说它有帮助。XP 只是一个安静的数字。仅此而已。
也没有自由聊天模式,原因在对话那一节说过:它没有终点,也没有失败的可能,而一个不可能失败的任务,不会让人感到进步。
结语
出声说,在一个有目标的情境里,尽可能多地自己去够那些词。从对方的回应里得知有没有奏效。明天再做同类的事,不是现在。一天三段,然后停下。保住连续记录,原谅错过的那天。不为「出勤」发奖励,只诚实地记下你说了什么。
这些没有一条是原创的。它就是研究很久以来对人如何学会开口说的结论,去掉了那些让应用在第一分钟显得更讨喜、在第一个月显得更空洞的部分。想感受一下,应用是免费的,而且第一段对话本来就应该很难。
ConvoLive 的数据来自我们自己对 2026 年 8 月 18 日至 25 日注册用户的分析,已剔除测试账号。「回来」指在之后的任何一个日历日有任何活动,观察窗口至少为注册后五天。
参考资料
-
Swain, M. (1985). Communicative competence: Some roles of comprehensible input and comprehensible output in its development. In S. Gass & C. Madden (Eds.), Input in Second Language Acquisition (pp. 235–253). Newbury House. ↩
-
Freed, B. F., Segalowitz, N., & Dewey, D. P. (2004). Context of learning and second language fluency in French: Comparing regular classroom, study abroad, and intensive domestic immersion programs. Studies in Second Language Acquisition, 26(2), 275–301. doi:10.1017/S0272263104262064 ↩
-
Roediger, H. L., & Karpicke, J. D. (2006). Test-enhanced learning: Taking memory tests improves long-term retention. Psychological Science, 17(3), 249–255. doi:10.1111/j.1467-9280.2006.01693.x ↩
-
Karpicke, J. D., & Roediger, H. L. (2008). The critical importance of retrieval for learning. Science, 319(5865), 966–968. doi:10.1126/science.1152408 ↩
-
Kang, S. H. K., Gollan, T. H., & Pashler, H. (2013). Don't just repeat after me: Retrieval practice is better than imitation for foreign vocabulary learning. Psychonomic Bulletin & Review, 20(6), 1259–1265. doi:10.3758/s13423-013-0450-z ↩
-
DeKeyser, R. (2007). Skill acquisition theory. In B. VanPatten & J. Williams (Eds.), Theories in Second Language Acquisition: An Introduction (pp. 97–112). Lawrence Erlbaum. ↩
-
Long, M. H. (1996). The role of the linguistic environment in second language acquisition. In W. C. Ritchie & T. K. Bhatia (Eds.), Handbook of Second Language Acquisition (pp. 413–468). Academic Press. doi:10.1016/B978-012589042-7/50015-3 ↩
-
Mackey, A., & Goo, J. (2007). Interaction research in SLA: A meta-analysis and research synthesis. In A. Mackey (Ed.), Conversational Interaction in Second Language Acquisition (pp. 407–452). Oxford University Press. eprints.lancs.ac.uk ↩
-
Bryfonski, L., & McKay, T. H. (2019). TBLT implementation and evaluation: A meta-analysis. Language Teaching Research, 23(5), 603–632. doi:10.1177/1362168817744389. Re-analysis: Xuan, Q., Cheung, A., & Liu, J. (2025). Language Teaching Research. doi:10.1177/13621688221131127. Review: Boers, F., & Faez, F. (2023). Meta-analysis to estimate the relative effectiveness of TBLT programs: Are we there yet? Language Teaching Research. doi:10.1177/13621688231167573 ↩
-
Kornell, N., Hays, M. J., & Bjork, R. A. (2009). Unsuccessful retrieval attempts enhance subsequent learning. Journal of Experimental Psychology: Learning, Memory, and Cognition, 35(4), 989–998. doi:10.1037/a0015729 ↩
-
Bjork, E. L., & Bjork, R. A. (2011). Making things hard on yourself, but in a good way: Creating desirable difficulties to enhance learning. In M. A. Gernsbacher et al. (Eds.), Psychology and the Real World (pp. 56–64). Worth. bjorklab.psych.ucla.edu ↩
-
de Jong, N., & Perfetti, C. A. (2011). Fluency training in the ESL classroom: An experimental study of fluency development and proceduralization. Language Learning, 61(2), 533–568. doi:10.1111/j.1467-9922.2010.00620.x ↩
-
Bygate, M. (2001). Effects of task repetition on the structure and control of oral language. In M. Bygate, P. Skehan & M. Swain (Eds.), Researching Pedagogic Tasks: Second Language Learning, Teaching and Testing (pp. 23–48). Longman. routledge.com ↩
-
Suzuki, Y., & Hanzawa, K. (2022). Massed task repetition is a double-edged sword for fluency development: An EFL classroom study. Studies in Second Language Acquisition, 44(2), 536–561. doi:10.1017/S0272263121000358 ↩
-
Kakitani, J., & Kormos, J. (2024). The effects of distributed practice on second language fluency development. Studies in Second Language Acquisition, 46(3), 770–794. doi:10.1017/S0272263124000251 ↩
-
Cepeda, N. J., Pashler, H., Vul, E., Wixted, J. T., & Rohrer, D. (2006). Distributed practice in verbal recall tasks: A review and quantitative synthesis. Psychological Bulletin, 132(3), 354–380. doi:10.1037/0033-2909.132.3.354 ↩
-
Settles, B., & Meeder, B. (2016). A trainable spaced repetition model for language learning. Proceedings of ACL 2016, 1848–1858. research.duolingo.com ↩
-
Gollwitzer, P. M., & Sheeran, P. (2006). Implementation intentions and goal achievement: A meta-analysis of effects and processes. Advances in Experimental Social Psychology, 38, 69–119. doi:10.1016/S0065-2601(06)38002-1 ↩
-
Nunes, J. C., & Drèze, X. (2006). The endowed progress effect: How artificial advancement increases effort. Journal of Consumer Research, 32(4), 504–512. doi:10.1086/500480 ↩
-
Silverman, J., & Barasch, A. (2023). On or off track: How (broken) streaks affect consumer decisions. Journal of Consumer Research, 49(6), 1095–1117. doi:10.1093/jcr/ucac029 ↩
-
Sharif, M. A., & Shu, S. B. (2017). The benefits of emergency reserves: Greater preference and persistence for goals that have slack with a cost. Journal of Marketing Research, 54(3), 495–509. doi:10.1509/jmr.15.0231 ↩
-
Duolingo (2020). Improving the streak. blog.duolingo.com ↩
-
Horwitz, E. K., Horwitz, M. B., & Cope, J. (1986). Foreign language classroom anxiety. The Modern Language Journal, 70(2), 125–132. doi:10.1111/j.1540-4781.1986.tb05256.x ↩
-
MacIntyre, P. D., Clément, R., Dörnyei, Z., & Noels, K. A. (1998). Conceptualizing willingness to communicate in a L2: A situational model of L2 confidence and affiliation. The Modern Language Journal, 82(4), 545–562. doi:10.1111/j.1540-4781.1998.tb05543.x ↩
-
Bashori, M., van Hout, R., Strik, H., & Cucchiarini, C. (2021). Effects of ASR-based websites on EFL learners' vocabulary, speaking anxiety, and language enjoyment. System, 99, 102496. doi:10.1016/j.system.2021.102496 ↩
-
Tai, T.-Y., & Chen, H. H.-J. (2023). The impact of Google Assistant on adolescent EFL learners' willingness to communicate. Interactive Learning Environments, 31(3), 1485–1502. doi:10.1080/10494820.2020.1841801 ↩
-
Deci, E. L., Koestner, R., & Ryan, R. M. (1999). A meta-analytic review of experiments examining the effects of extrinsic rewards on intrinsic motivation. Psychological Bulletin, 125(6), 627–668. doi:10.1037/0033-2909.125.6.627 ↩
-
Mekler, E. D., Brühlmann, F., Tuch, A. N., & Opwis, K. (2017). Towards understanding the effects of individual gamification elements on intrinsic motivation and performance. Computers in Human Behavior, 71, 525–534. doi:10.1016/j.chb.2015.08.048 ↩
-
Hanus, M. D., & Fox, J. (2015). Assessing the effects of gamification in the classroom: A longitudinal study on intrinsic motivation, social comparison, satisfaction, effort, and academic performance. Computers & Education, 80, 152–161. doi:10.1016/j.compedu.2014.08.019 ↩