晚点晚点聊 LateTalk2025年11月24日· 1:15:01

142: 斑马CPO修佳明:一款能主动教学的 AI 产品是如何出现的

修佳明以斑马首席产品官身份,详解斑马首款全栈式AI产品“斑马口语”:一款供6-12岁儿童使用的AI外教一对一实时口语课,界面由AI外教直播、孩子画面和互动动画课件三部分构成;AI为二维形象,每节25分钟拆成十几个两三分钟的小环节,一个级别96节课覆盖一年。产品立项于2023年8月、耗时两年多才发布,核心是把教学法、心理学、课程目标与“永远积极反馈”的人格设定训练进自研模型,让AI在边界内发挥“幻觉/创造力”,成为能主导课堂的Agent;课后整理孩子信息时则会调用DeepSeek。他区分了这种主动式产品与市面被动陪聊/陪练的本质差异:用向量数据库建立孩子长期记忆,用脚手架、类比和分级提问控制教学难度与节奏,并表示AI外教刻意不像人、有“独立位格”,为的是降低孩子开口的情感过滤阈值。他还披露内测已完成超7000节课,最长用户连续上满26周,课程以“有效开口100次以上”为强度参考;未来看好的方向是AIGC实时生成课件和原生多模态,并认为儿童教育“经验比数据更有说服力”,课件与教研专业度是难被模型进化冲掉的壁垒。团队约200人、研发投入约2亿元,目前售价为每级别3600元,按学习产品而非AI产品付费,且不担心一般规模公司的竞争;从选题到新级别上线目前仍需约一年。

  1. 0:00开场
  2. 4:36立项与方向
  3. 8:01与模型搏斗
  4. 14:42口语需求
  5. 20:56主动教学
  6. 24:08教学法与难度
  7. 35:54情绪价值
  8. 41:38AI人格
  9. 47:37反馈与评估
  10. 56:28未来与壁垒
  11. 1:04:05定价与竞争
  12. 1:11:42团队与发布

PodHood 提供支持

文字稿

开场0:00

修佳明0:01

这两年多我们其实是在跟 AI 模型搏斗 。其实在我们看来 , 所谓的 " 幻觉 " 其实并不一定是一个负向的词 。

有的时候它是代表了一个 AI 模型的一个创造力 。 这个我觉得也是 AI 外教的一个很大的优势 , 它会降低这个情感的过滤阈值 。

大概就是医疗教学跟 AI 的结合 , 可能跟其他领域都不太一样 ,因为它涉及很人命关天的事情 。 但是关于教育这件事情 , 数据没有经验更有说服力 。

你不管是从任何的渠道拿来的数据 , 从网上拿来的数据 , 从各大企业拿来的数据 , 从学校拿来的数据 , 你没有办法用到你面对这个孩子的时候你应该怎么教他说英语 。

用不上这个事情 。

申远0:44

大家好 , 欢迎收听 《 晚点聊 LateTalk》, 我是 《 晚点 》 的记者申远 。 本期节目由斑马口语特别支持播出 。

2011 年, 乔布斯在最后一次与比尔 · 盖茨会面的时候 , 谈到了自己的一个观察 , 那就是教育领域似乎没有从技术的巨大进步中受益 。《 中庸荒凉的世界 》 有人把它总结为了 " 乔布斯之问 "。

盖茨对这个问题其实有个自己的解释 : 技术只有在更多致力于提供个性化的课程 ,以及带有启发性的反馈的情况下, 才能从根本上重塑教育 。

这听上去就很像是现在大模型正在发生的事情 。 而在所有的教育类别里 , 语言 , 特别是口语的这个学习 , 又是其中一个特别典型的代表 。

大模型提供了过往技术一直难以提供的口语交互的个性化表达 、 即时反馈 , 同时它又不依赖于真人, 很容易地实现大规模化的部署 。

因此很多人都认为在大模型技术落地的领域当中, 它是一个非常确定无疑的赛道 。 但是事情真的是这样子的吗 ?

今天关于 AI 大模型 、 关于口语 ,以及关于 AI 的这个教育产品 , 我们很高兴地邀请到了斑马首席产品官修佳明 。他从事儿童数字内容教育工作已经超过 9 年的时间了 , 我们很想听听他关于大模型 Agent 在教育 , 特别是口语这个领域落地的一些想法 。

修佳明1:55

那修老师可以先跟我们的听众朋友们打个招呼 , 然后自我介绍一下 。

好的 , 听众朋友们大家好 , 我叫修佳明 , 来自斑马口语 , 然后主要是负责斑马产品的研发工作 。

哦 , 真的很简短 。

申远2:09

来之前我们碰的时候 , 修老师说他们一般都不做那个长的自我介绍 。OK, 我们知道其实之所以有今天这个契机能跟修老师聊一下 ,是因为我们知道斑马咱们最近刚刚推出了一个全新的 , 可以说是口语的产品 。

它是这个基于 AI Agent 的策略了 。 我们开宗明义 , 可以先请修老师先讲一下咱们这个产品 , 然后我们再回过头去聊一下之前咱们都做了什么 , 然后把这个东西串起来 , 好不好 ?

修佳明2:33

好的好的 , 可以 。 斑马口语其实是一款针对孩子口语学习的一个由 AI 驱动的这样的一个产品 。 它的形式是一个 AI 外教一对一直播学习的一个形式啊 。

产品的界面是一个三分屏 ,有一个直播区域是 AI 外教的 , 就是它的它是一个 AI 虚拟的形象 , 嗯 , 是一个二维的 AI 老师 。

嗯 , 另一个直播的窗口是留给孩子的 , 嗯 ,是播放孩子的直播流 ,他可以跟 AI 老师进行互动 。 主要的这个课件区域是交互式的动画课件 ,由这个三个部分组成了这个课堂 。

嗯 , 每节课 25 分钟 , 这样我们每个单元有 4 节课 , 我们一共分了 6 个级别 , 每个级别有 96 节课 , 大概是这样的一个体系 。

你这个上课的形式和传统的线上的一对一外教学习是比较像的 , 嗯 , 区别就是原来的这个真人外教换成了 AI 外教 ,但是实际上它整个产品都是由 AI 内核驱动的 , 然后这个差异还是比较大的 。

申远3:35

OK,其实我们一开始看到这个产品形态的时候 ,因为我也稍微简单的那个试用了一下 ,其实刚才修老师其实也提到了 , 它是针对小朋友的这个口语学习来讲的 。

然后区别之一其实就是它有一个虚拟的形象 , 等于是说带着小朋友来 , 那个它是由这个 AI Agent 驱动的 , 对吧 ?

修佳明3:54

对对对 。

申远3:54

其实因为我们也知道 , 一直以来 , 包括斑马自己在 AI 战略上的这个进展 ,其实我们过去的时候其实都了解比较多 , 然后当然也包括整个呃园林科技的这个 AI 战略 ,其实这几年来也是大家对于头部的这种在线教育集团比较关注的一个 , 可以说是新的一个走向吧 。

那呃 ,其实这个斑马口语当然就是目前为止最新的这个产品了 。 那刚好我们聊到这了 , 那修老师其实也可以给我们回顾一下, 怎么在这个节点上推出的这个东西 , 然后还有它在咱们整个大的这个集团也好 , 斑马也好的这个 AI 战略里边处于一个什么样的位置 , 或者说过去的发展怎么样走到现在这一步的 , 可以给我们回顾一下 。

修佳明4:35

那我就从远一点开始说 。

立项与方向4:36

申远4:36

哎 , 可以可以 , 太好了 。

修佳明4:37

因为我们公司 2014 年开始其实就组建了这个 AI 的 Lab, 就 AI 实验室 , 然后那个时候其实大语言模型还没有特别的突出 。

我们主要做的是一些 , 比如说像呃自身算法啊 , 然后像是一些呃 , 比如说呃视觉识别啊 ,TTS、ASR 啊 , 就是语音识别啊 , 测评啊这些工作 。

然后在这个过程当中, 呃 ,因为斑马产品的这样一个落地 , 所以我们收集了积累了非常多的儿童语音的数据 , 所以就就让我们拥有了呃 , 可以说是在行业里面儿童语音识别和做儿童英语测评的这样最好的一个模型 , 就是它的精准度是特别适配孩子这个这个儿童这个年龄段的 。

申远5:15

但但这个模型其实是更上一代的 。

修佳明5:17

对 , 这是上一代的 。 嗯 , 我的意思是说 , 就是像斑马 AI 学其实一直都是也是底层有很多 AI 技术的 , 只不过是不是大语言模型 。

所以我们对 AI 这一块呃一直关注的都比较紧 。 呃 , 大概是 2023 年 8 月左右 , 我们是立项做这个斑马口语 ,但这个时候其实我们对 AI 一直都是比较关注 ,在现有的主线产品里面 ,其实也开始尝试结合 AI 做一些功能上的改进 。

嗯 , 比如说有一些传统的这种对话的功能 , 我们会引入 AI 模型 , 让这个对话更具有灵活度 ,但这些都是在现有的产品架构的基础之上做的一些呃灵活性的一些改进嘛 。

嗯 ,在我们看来都还不属于就是 AI 时代的产品 , 还是上个时代的这个产品思路 , 然后加了一些 AI 的功能 。

呃 , 那斑马口语其实是我们整个集团现在发布了 , 就可以说是最早的 , 或者是最最先进的 , 就是完全从底层就由 AI 来构建的这样的一个产品架构和一个落地方案 。在这个我们内部有一个比喻性的说法 , 说它是全栈式的 , 就是它从前端到后端 , 然后从后台到到 UI, 就各个层面 , 我们在设计的时候都考虑到怎么跟 AI 做配合 , 然后它整个的这

个产品能够成立 ,也是基于 AI 能力的一个考量 。 然后我们选择的是一个非常细分的这样的一个领域 , 就是儿童口语学习 , 这个是非常窄 、 非常细分的这样领域 。

我们为什么选这么这么精细的这样的一个方向呢 ? 就是我们是想先在一个比较有确定性的 、 比较窄的一个方向去特别深入的探索 AI 的一个能力 。

嗯 , 所以就做了这样的一个像是一个尖头的这样的一个产品 , 希望能把整个就是在这一个问题上就彻底的解决 。

这个是我们当时要做这个产品的一个一个初衷 。

申远7:03

听到这其实听到两个关键点 。 第一个就是你刚才说的 ,其实是前年 8 月份立项的这个项目 , 对吧 ?

其实那做到现在其实也两年多了 。

修佳明7:12

对对对 。

申远7:12

现在咱们这个产品是不是在大家听到这个播客的时候 , 应该已经就上线了 , 对吧 ? 哎 , 对对 ,是 。

这是我 get 到的第一个关键的点 。 第二个就是您刚才所说的彻底的解决这个确定性的这个问题 。其实我知道您其实是研究儿童心理 ,有这个有这个方面的教育的背景 。其实我们在说 AI Agent 产品的相关的问题的时候 , 很多人都会对 , 比如说它的幻觉啊 , 它的呃不可控性啊 , 或者是它的一些比较模糊的地方呃有一些怀疑 。

很多时候它也被认为是 AI Agent 的产品很难落地 , 乃至商业化的一个这个关键 。 所以您刚才说的这个呃确定性 ,其实我有一些好奇 , 您从 23 年的 8 月立项开始 ,在一个什么样的阶阶段的时候 , 或者说这个技术到了哪一步的时候 , 您觉得这个确定性的问题其实是可以被解决的 ?

与模型搏斗8:01

修佳明8:03

嗯 ,其实这两年虽然大语言模型的发展是比较快的 ,但是对于我们这个产品来说 ,其实最早的那个能力就基本上已经够了 。

继续的发展只是说我们整体的产品的呈现效果会更好 , 然后效率会更高 。在确定性的这个问题上 ,其实从一开始就有了一个大致的一个解决方案 。

基本上我们的逻辑是让 AI 在一定的边界之内自由发挥 , 然后这也是我们为什么做了两年多的一个原因 。

这两年多我们其实是在跟 AI 模型搏斗 , 一边要保存它的灵活性 , 它的这个生产性 。其实在我们看来 , 所谓的幻觉其实并不一定是一个负向的词 。

有的时候它是代表了一个 AI 模型的一个创造力 。在实践中我们也看到 , 就是 AI 会给出很多我们预想不到的反馈 , 去配合孩子们的一些兴趣和表达 。

那这个其实是我们我们无法预先去设定好的 。 我们也比较珍视这个 AI 的这种能力 ,但另一方面我们也要确定 , 就是 AI 它的表达要限制在我们给它设定好的一个边界内 , 它是有范围的 。

那这个一方面是它要完成教学功能 , 就是要跟着孩子把每一个环节的学习都去落到实处 。 嗯 , 然后为了促成这一点 ,其实我们是通过整个产品的这个节奏设计来实现的 。

我们每一个 25 分钟其实都拆分成十几个环节 , 拆得很碎的话 , 那每一个环节就两到三分钟 。 这么短的一个时间内要完成的一个目的是非常明确的 , 那 AI 就会事先知道这个环节它要达到的一个目标 , 会跟孩子一起去实现这个目标 。

所以它的所有的话都会引向达成这个目标 。 嗯 , 它就会成为一个导向性非常强的 , 就是有主导能力的这样的一个 AI Agent, 然后去配合这个课件去把整个的学习过程完成 。

从另一个角度来说的话 , 我们要考虑到这个就是模糊性的这这种问题 , 所以我们对 AI 模型投入了非常大的人力进行标注 、 呃质检和测验 。

这个其实就是在三个步骤上, 我们都去进行了一些专项的一些操作吧 。 就是在训练模型的时候 , 我们会对数据进行一个清洗 , 进行分类 , 会进行一些强化训练 , 然后比如说会进行一些对抗性的训练 , 就找茬 , 然后它如果犯错了 , 我们就说这个错了 , 然后让它知道哪些呃哪些话是不能说的 , 哪些用法是不对的 。

呃 , 然后还会进行一些奖励性的训练 , 就是给它一些正向的例子 , 让它学习 。 呃 , 然后到了上线前 , 我们还会进行比较大规模的这个验证 , 会有那个测试集 , 这个测试集也会根据我们的整个的数据数据的收集不断的更新 。

嗯 , 所以经过了这个上线前的训练还有测验 , 呃 , 等到上线的时候 , 我们其实也接入了一个实时监控的系统 。

这是园林大模型 , 呃 ,其实就有有提供这个支持 , 我们就会有实时的去进行对这个模型的一个监控 。 如果比如说涉及到一些错误的东西 , 或者是敏感词 , 它就会意识到 , 然后会 , 然后同时呢 , 我们还会有追加的 , 就是这个产品使用之后, 会及时的会有人工的去再进行一个质检和标注 , 然后反过来用真实的案例再去约束这个这个大模型 。

然后等到我们已经验证了 , 说这个其实我们每一节课其实就是一个产品 , 对我们来说都要一个一个一个的做 。

所以我们以这个为单元去进行这个研发 , 然后就是每每 25 分钟确定了 , 这 25 分钟我们就放在这里 , 说它是可以用的了 。

申远11:12

所以等于是跟我们过往那个开发 AI 产品的那个想象好像不太一样 , 就是好像是您您刚才说的是说 25 分钟一个 , 然后这个就过了 , 对 , 然后再再搞下一个 。

修佳明11:23

对对对 ,其实刚才您说一个跟 AI 模型在搏斗这个概念 , 我觉得还蛮有意思的 。 因为您说它会有意想不到的一些回复 , 您觉得您印象中有什么让您比较惊艳的 、 意想不到的那种地方 ?

这个还是挺多的 , 就是 AI 会做一些发挥 。 嗯 , 比如说它在跟小朋友聊天的时候 , 小朋友有一次说到了自己有一个什么礼物 , 然后啊 ,因为我们除了这个 AI 老师之外, 还给小朋友设计了一些 AI 的学伴啊 , 就是其他的也不是小朋友 , 对 , 就是小机器人。

对对对 , 嗯 , 对 , 我对我有看到像像小机器人似的 , 然后有一个小机器人就会说 :" 我很嫉妒你 。"I'm jealous, 就这就说这句话 , 然后那个小朋友就觉得挺开心的 ,因为因为就是它明显是针对着它的一个反应 , 然后给出了一个有情绪化的这样的一个反应 。

申远12:10

小小小朋友也能听懂这个这个单词 , 对吧 ?

修佳明12:13

对 ,因为因为这个也是我们做过做过一个限定的 , 就是这个这个模型其实是知道在在在做出反馈的同时, 它其实是知道这个孩子的水平的 , 所以它的用词也会去进行自己进行一个筛选 , 就是能能够保证说它是大概是能听懂的这个水平 。

申远12:30

对 , 咱们这个产品针对的年龄段是 ?

修佳明12:32

大概是 6 到 12 岁 , 对 ,但是主要还是针对英语水平来筛选 。

申远12:37

哦 , 所以它的这个呃词库的范围等于是咱们在做产品设计的时候 , 预先已经把它规定进去了 。

修佳明12:43

对对对对 ,因为这个标准还是挺清晰的 。

申远12:45

呃 , 就是说根据你们的那个呃不同的 level 的那个档次的这个体系 。

修佳明12:51

对对对 , 您刚才还说这个是咱们因为上线了嘛 , 所以这个是等于是整个咱们大的集团第一款的这个 AI Agent 的产品 。

听上去这个意思就是感觉好像还有别的不少的 AI Agent 的产品 。

申远13:04

我我们肯定在这方面有很多的尝试 ,而且也也不是 AI Agent,AI Agent 其实做了很多 。 嗯 , 就是在各个产品线里面其实有很多 。

我们我就是斑马口语 , 它唯它的最大的区别其实就是像我说的 , 它是一个全栈式的 AI 产品 。 嗯 ,AI Agent 只是这个产品里的一部分 ,但是它从呃从底层 , 然后到最最终的这个表达层 ,其实全部都是有 AI 介入和 AI 来驱动的 。

对对对 , 然后这一点其实是是目前是唯一一款 。 我们刚才聊的时候 , 就是谈到了整个园林科技的 AI 战略 , 还包括现在这个时间点位 。

那其实在这个节点上, 您觉得呃推出这个产品 , 它是一个基于什么样的一个考虑呢 ? 或者说呃咱咱说的更大一点 , 就是说呃到现在这个阶段 , 整个中国的这个教育市场的这种变化趋势 , 包括您刚才说的这 6 到 12 岁这个年龄段的这个趋势 , 咱们有一些怎么样自己的判断吗 ?

修佳明13:59

嗯 , 说实话 , 如果理想的来说的话 , 我们是希望 23 年或 24 年就推出这个产品的 。

申远14:04

这个这这个一会可以重点聊一下, 为什么 delay 了 。

修佳明14:07

对 , 就是研研发是比较困难的 , 这个产品研发是比较困难的 。 所以我们之所以选择在这个时间点推出 , 就是因为我们已经确信这个产品是有效的 、 安全的 、 有益的 。

嗯 , 然后呃各个方面都已经经过了内部的一个论证 , 然后外部的做了充分的一个测试吧 , 然后我们觉得可以了 , 我们就第一时间就发布了 。

对 , 然后具体的时间点可能哪一天其实倒不是很重要啊 ,但是就是说 11 月肯定是我们觉得 OK 了 , 对 , 就是可以发布了 。

申远14:36

所以在您看来其实已经慢了 。

修佳明14:38

呃 , 肯定是慢了 。 对对对 , 我们还是希望这个东西越早的让孩子们用到越好 。

口语需求14:42

申远14:42

那您能谈谈就是说您对于比如说孩子们 , 乃至乃至于家长们在口语这个方面的这种需求也好 , 或者诉求也好 , 您是怎么看的吗 ?

毕竟您我我我我之前看到您的资料 ,其实您在这个方面已经有非常多年的这个比较资深的这个经验 。

修佳明14:57

我其实就是作为一个观察者吧 , 就是看我们我们国内的家长和孩子面对英语学习的这个状况 ,其实英语学习是挺复杂的 ,而且它的面向比较多 。

但是其他的呃能力层面 , 比如说像听力啊 、 阅读啊 、 嗯单词啊 , 这些语法实际上都是可以通过比如说自学或者是一个老师教学就能学会的 。

但只有说口语这一个能力 , 你必须得有一个真人或者是一个对话的对象和你实时的交流 ,而且它要知道你的一个说话的水平 , 能够让你跟它说下去 ,而且要提供充分的足够大量的这样的一个开口机会 , 你的口语能力才能真正的去进行提升 。

那这个资源其实一直不光是在中国 , 就是一直在外语学习的学习者那里都是比较稀缺的 。 所以嗯 , 像成年人也会在网上找一些语班啊这些 , 然后那小朋友以前会找外教来来教自己说口语 ,因为这个确实是无法替代的 。

你不可能一个人坐在房间里就把口语给练了 , 那这个事情是做不到的 。在儿童这个学习成长的阶段 , 语班也没有办法达到一个让你的口语提升的这样的一个效果 ,因为它里面还是涉及到了很多的教学细节 , 包括整个的呃教学路径的设计啊 , 教学材料的组织啊 , 针对性的各个知识点怎么攻破这些东西 ,其实呃非专业的母语者也无法做到这一点 。

然后呢 , 专业的中国老师 ,他的发音口语能力能够到这个水平的也很少 , 能够提供这项服务的也比较少 。

所以一直以来其实就我个人的观察 , 嗯 , 大概就是在呃 KET 水平之前吧 , 或者在一线城市 , 大概是在 PET 水平之前 , 孩子还可以靠各种呃 , 比如说有学爸妈爱学的 , 然后有上那个跟着校内好好学的 , 或者是其他的一些英语补习机构 , 大概是口语能摸到那个水平 ,但是都停在那了 。

一直到高考到大学 , 英语还是那个水平 。 嗯 , 就是出呃 , 比如说大学毕业了 , 出国留学的时候还要突击口语 , 突击托福口语 ,因为它的它的水平一直就是卡在了这个平面上 ,因为它没有这个资源 ,但并非它没有这个需求 。

因为如果你的口语 , 说实话 , 如果口语这一个单项落后非常多的话 ,也会影响你整体的语言的感觉和提升的一个空间 ,也会影响你学习英语的自信和兴趣 。

所以这个一直以来都是就是我们学习英语的一个一个痛点 。 对对 , 我我看着是很难受的这个事情 。

申远17:23

哈哈 , 所以就是就是所谓的我们中国人都很熟的那种哑巴英语嘛 , 对吧 ?

修佳明17:28

对 , 现在也不能说哑巴了 ,因为大家都能到一定的水平 ,但是呢 , 就是就止步不前了 , 就停在那了 。

申远17:34

咱们对于这种的 , 比如说市场规模 , 或者说用户的数量这种的呃这种的需求 ,有比如说量化的数据来做一些判断吗 ?

修佳明17:43

我觉得这个不能说死 ,但是我我的判断是 , 凡是学英语的孩子都有这个需求啊 , 之前之前 。

申远17:52

所以市场的判断是全部市场 。

修佳明17:54

哎 , 我我觉得我就理想理想理想化的应该是这样 , 就只要是你学英语 ,而且至少要学到高中的这个水平 , 你对口语一定是有学习和训练的需求的 。

因为之前也有也有同事还有朋友会会跟我聊说那个口语学习啊 , 就是挺难的 ,其实对成年人来说也挺难的 。

这个是不是只是少数人的需求 , 要说这么好的一个一个口语 。 然后我举的一个例子就是刚刚有汽车的时候 , 大家不觉得开车是个需求 , 只有少数的人, 比如说有身份的人, 有钱人 ,他开个汽车其实是个身份的象征 。

因为那时候汽车走的也慢 , 都不一定比骑马方便 ,但并不代表人没有这个需求 。 你看现在所有的人对汽车都有需求 , 就是说你没有这个产品 , 大家就没有这个需求 。

嗯 ,但实际上作为英语学习这件事情来说 , 听说读写根本都不用论证 , 就说这就是一个需求 , 只不过是之前没有被满足而已 。

申远18:45

是不是其实就是写这个作文这种的能力 ,其实也是算是一个传统上讲 , 我们觉得好像中国的同学们比较难突破的一个地方 ,因为它好像还是也需要一种个性化的这种 。

修佳明18:56

嗯 , 写是也是一种输出形式嘛 , 对 ,但是写的训练说实话相对来说简单 。

申远19:02

嗯 , 怎怎么怎么讲 , 就是比说要简要简单很多 。 对 ,因为它它不要求你实时反应 , 就这个差异还是很大的 。

就是因为写写 , 我们会有很多的关于写作的训练方法 , 会教你啊 , 比如说从简单的句子写到复杂的句子 , 然后段落怎么构成 , 谋篇布局有一些呃有些技巧 , 然后这些其实都可以的 。

然后一些例子啊 , 然后你可以背一背 , 背了之后再模仿 , 模仿了之后再再替换自己的素材 , 通过积累 。

所以大家可以看到孩子在学习 ,在学习过程当中, 假如要准备考试 , 那写作的突击很快 , 就三个月一定能一定能有见效的这个这个写作 。

刚才您说那一套让我想起了高考 。

修佳明19:41

啊 , 对啊 , 对啊 , 就是再背那个范文什么 , 背那个是独特的句子结构什么 。 所以写作是真的能训练的 ,而且写作你可以自己一个人默默的练 , 你就去阅读模仿 , 然后多写写到这又去卡住了 , 你就想一想 。

但是口语不行 , 你不能跟一个真人, 比如说你在买东西或者在问路 ,在这过程中你你停下来就查字典想一想 , 这个就很尴尬了 , 就是这个对话就进行不下去了 。其实在中国的这种标准化考试的范呃 , 就是比如说像托福还是呃 , 还有雅思啊 , 这样的标准化考试里 ,其实好像也一直以来口语都是一个平均分偏弱的一个情况 。

对对对 , 一直都是一个弱项 ,而且大家都要去怎么说呢 , 背题背模板去应对 。

申远20:22

对对对 , 都应该有很多人都有这个同样的这个经历 。

修佳明20:25

对对 ,因为您刚才说的一点就是说像呃 ,不管是写作还是口语 , 它其实是一个输出式的表达 , 那其实口语还更多了一种这个互动性 。

对对对 , 然后作为第一款产品 ,其实是不是可以把咱们的这个斑马口语当做是一个主动式的这种 AI 产品 ,而不是过往我们一直以来觉得它是起到一个辅助的作用或者可派来的作用 。

对对对对对 , 斑马口语这个主动性是非常 , 这个差异化是非常大的 ,因为市面上呃名字叫 AI 外教的这样的产品也比较多 。

申远20:56

哎 , 对 , 这其实是我的下一个问题 。

主动教学20:56

修佳明20:58

对对 , 就是 AI 口语训练啊 , 这种陪陪练啊 , 陪陪聊啊也比较多 。 这就是我刚才说的 , 要真正的提升口语能力 , 就真的是在学习的话 , 那被动式的这种陪聊和陪练其实是不够的 。

它最好的效果是能维持你到现在的水平 ,因为我们要要去提升一项能力的话 , 呃 , 从阿语习得或者是外语教学的角度来看的话 , 你一定是要在现有的基础上不断提升的 。

那提升的这个一个是说提升的度 , 一个是提升的量 , 一个是提升的具体的这个选材 , 都是很有讲究的 。

这个东西有有比较强的专业性 。 你就比如说如果我们就看剑桥体系的话 , 那哪个级别覆盖了哪些词 , 这个还是有一定科学原理的 ,因为它会跟你在这个阶段阅读到的这个材料 、 听到的材料和使用的材料是有关系的 , 跟你的生活范围 、 认知范围也有关系 。

它会把这些词和句式纳入到这个级别的学习内容里面 。 那这些其实大模型是不了解的 ,而且不会应用 , 它也不知道你 。

而且大模型呃 , 还有一点就是它没有长期记忆 , 就如果不做成产品的话 ,不做成专业性的产品 , 它没有长期记忆 , 它只能记住你过去几轮的这个聊天 , 它不知道你的水平是什么 , 它没有办法去给你定制一个长线的 。

你像我们一个级别是一年, 其实很长 , 它没有办法给你制定一个长线的一个学习计划 , 带着你去扎扎实实的把这个口语迈一个台阶 , 这样是做不到的 。

申远22:13

像您说的这种呃 , 长期记忆其实也是大模型技术演进过程当中一个嗯 , 怎么说呢 , 一个核心的 , 大家在探讨的一个技术上的突破的一个方向 。

我知道咱们那个整个的这个集团 ,其实呃 , 模型的基座有咱们自研的这个模型 ,其实也有 DeepSeek 的模型 。

对 ,在这个产品里边 ,其实咱们您刚才也说到了 , 就是这个长所谓的长线记忆的问题 ,是怎么样在产品化的过程当中把它解决掉的 。

修佳明22:40

对于这个长期记忆的问题 ,其实我们是给每一个学员 , 就是学生吧 , 每个孩子建立了一个他自己的一个向量数据库 , 就是他完成了 25 分钟的学习 ,以及比如说三个月的学习 ,他说过的每一句话 ,他发出的每一个行为 ,其实都会被转化成这个数据 , 去存储在他自己个人的这个数据库里 。他并不是存储在模型里 , 对于模型来说 , 它是一个外部的一个数据库 。

然后等到再和这个孩子在交流的时候 , 这个孩子说出一句话是实时的一个信息嘛 , 那模型会结合这个信息 ,以及结合由这个信息去触发的那个外部的数据库里面的相关信息 , 一起揉合成一个反馈 , 这样就能会呈现出他了解孩子的所有的个性化的特点 。

你就是有了一个长期的记忆 , 然后这个数据库其实是多维的 , 比如说它也会记孩子的学习水平 , 然后呃 , 学习习惯 、 学习状态 , 它也会记孩子个人信息 , 比如他的兴趣习惯啊 , 家庭成员啊 , 然后比如狗的名字啊 , 这些都是都是能记住的 , 全部都可以存住的 , 对不对 ?

申远23:43

对对对对对 , 那像刚才我们提到的这种主动式的这个趋势 , 然后现在还有这个长期记忆 , 这当然是一种 Agent 技术的这种应用 , 可不可以把这个东西看作是它跟呃 , 过去的这种 AI 口语对话机器人的之间的那种本质的不同 ?

修佳明23:57

嗯 ,是是是本是本质不同的一点 。

申远24:00

对 , 您您觉得这个是说这个本质或者说这个质的不同 , 除了我们刚才其实已经带到了这几个点之外, 还有什么更多的 , 或者说你想补充的吗 ?

教学法与难度24:08

修佳明24:09

我觉得我觉得还有两点吧 , 就是还有一点不同 , 就是这个这个模型呃 , 我们在 25 分钟学习过程当中用的这个模型 ,其实是我们自研的模型 , 我们会对它进行针对性的训练 , 这个训练其实是融入了很多的教学法啊 , 然后心理学的技巧啊 , 语言学的能力 , 这些东西我们会提前的对这个模型进行训练 。

同时我们还会把每一个课件的信息 , 像我刚才说的 , 就每一个环节的学习目标 , 然后是怎么样怎么样的一个数据反映出已经达成了这个目标 , 都会预先的对这个模型进行训练 。

所以它是一个有教学引导能力的 , 或者说有主导性的这样的一个一个模型 , 它必须得配合这个课件来来展开这个学习活动 。

对 , 然后这一点其实就就完全已经不是大模型所做的了 , 可以说是一个呃 , 领域专业性的一个一个产品了 。

然后还有一点就是我们呃 , 还是基于口语学习这个需求 , 我们比较重视孩子的这个情绪和兴趣的一个维护 , 所以我们会对这个模型提很多的呃 , 针对性的要求 , 就是它的反馈的方向 , 比如说永远是要积极的反馈 ,不能说你错了 。

然后针对不同场景 , 我们会设定各种各样的场景 , 预先设定各种各样的场景 , 然后在测试过程中还会不断的补充这个场景 , 就是具体的孩子的场景 , 比如说他累了 ,他说他烦了 , 然后他说他很开心 ,他说他有疑惑 , 各种不同的场景 , 我们会告诉这个模型应该给出什么样的一个反馈 。

而且我们会告诉呃 , 模型在反馈的时候有一些条件嘛 , 比如说你一定要结合这个孩子说的具体的信息给反馈 , 你不能说你很棒 , 你要说你刚才说的这句话里的什么东西说的很好 , 说的很棒 , 这样让孩子能不断的收集到 , 就是呃 , 接收到就是针对他个人的一些情绪的这个鼓励 。

所以我们说它其实是一个有人格的 ,有人格的 AI 外教 , 对 , 就是它是有这个这个一个独立独立的人格 。

申远25:56

这个这个人格化的这个部分 ,其实也是训到了你们的专有的模型里头去了 , 对不对 ?

修佳明26:01

对对对 , 我我我们会给它设定一些基础的人设 , 就是这针对所有孩子 , 所有的这个课件 , 它都有这个基础人设 , 就他是一个什么样的人啊 ,他的性格怎么样 , 这个是写在模型本身里头 。

对对对 , 然后除此之外, 还会有一些针对这个孩子 。

申远26:17

那个是用用了所谓的外部的 , 就是模型之外的那个储存的 , 长线的储存的能力了 , 对吧 ?

修佳明26:23

对对对 , 所以还是一个嗯 ,其实刚才我就想问这个所谓的咱们的这个产品的结构的问题 ,其实您您还有补充的吗 ?

还是我我觉得刚才这个部分 , 就是关于它基础的人设 , 还有这个长期记忆的东西 , 已经讲的比较清楚 。

我们用到了一点 DeepSeek 的能力 ,但是不是在这个对话过程当中, 比如说是在整理孩子信息的这个过程当中 。

对 , 然后因为 DeepSeek 它的一些优势嘛 , 嗯 , 比如说这些课上完了 , 然后再整理这个孩子这些课的信息 , 我们要进行存储嘛 , 那对它生成一个报告和一个维度的梳理 , 这些我们有的时候会会会用到 DeepSeek。

申远26:54

哦 , 所以还是呃 , 两两个模型在各司其职 , 可以说哦 , 哎 , 这个其实还有一个产品结构的问题 , 刚好就说到这了 。

我稍微看了一下咱们那个产品的那个应用的那个状况 ,其实很多时候孩子说话并不是对着那个麦克 , 然后那个脸是在那个框里 ,他其实不是那样子的 。

那再比如说这个语音的拾取啊 , 还有这个处理的这个方面 , 我们有做什么工作吗 ? 因为我看那个虚拟的 AI 老师的这种反馈 ,其实还是总的来说还是能跟上他的这个反应的 。

修佳明27:24

是的是的 , 这个确实是有难度的 , 就是收音 , 然后还有这个识别这个方面 , 我们也是进行了挺多的建设的 , 然后就会根据各种各样的 , 我们会模拟各种各样的场景的呃 , 比如说有一些背景音啊 , 或者嘈杂的一个情况啊 , 然后因为我们一直在做这个呃 , 当然这就不是大模型的技术了 , 这个就是我们一直在做的这个云识别技术 , 上一

代的那种语音识别的技术 , 它虽然上一代 ,但是现在大家做的也没有说特别的特别的完备嘛 , 还在不断的进化 。

然后比如说我们之前一直在做的 , 就是我们可以提出成年人的声音 , 就类似于这种 , 然后而且甚至我们可以呃 , 比如说因为有的有的家庭有有二胎嘛 , 然后记住姐姐在上课 , 我们会记住姐姐的脸 , 然后会记住姐姐的声音 ,他的弟弟的声音 , 我们就不会被识别进来来干扰这个识别 。

对 , 会进行一些这样的这样的一些处理 , 然后会进行一些强化的训练 , 嗯 , 就是让比如说距离远近啊 , 说话的这个方向啊 ,其实这些都是能够大概率的 , 就是反正是可用到可用的这个状态 。

对对对 ,其实您刚才还说到了 , 咱们在打磨产品的时候 ,有一些基于斑马过往的一些呃 , 教学经验的总结 , 或者有些呃 , 教学法上的这种实践 。

我也知道您是研究这个儿童教育 , 儿童教育这个方面的专家 ,其实在这个领域 , 像我们这种外行人有的时候就比较好奇 , 就是这个是怎么体现出来的 。其实您刚才说到蛮多的 , 就是说这个课程开发还蛮困难的 ,因为要一节一节课的磨 , 然后当然它要基于这个课件 , 又要控制这个模型的这个幻觉 。

但是呃 , 教学法的这个部分 , 就是它的这个困难的地方 , 或者说您觉得不好 deliver 的那个地方在哪里啊 ?

您觉得呃 , 一个是这个有一些通用教学法 , 或者是这个细节的一个应用吧 , 比如说我我我们在讲一个句子的时候 , 呃 , 孩子说不说不全 , 或者说不准 ,但他可能是只有一部分说不准 , 然后这个时候应该怎么引导他 , 把一个复杂的句子说好 , 又不打击他的信心 , 那这样我们就会提供一些脚手架的策略嘛 。

申远29:23

什什么的策略 ? 脚手架 , 脚手架嘛 , 脚手架的策略 , 那就是涉及到一些拆分 , 或者是呃 , 降级 。

那比如说我先问了一个特殊语言句 , 然后孩子没拿出来 , 那这个时候就需要根据这个具体的这个孩子的水平和这个语境来设计下一步应该怎么问 。

比如说我可以问一个一般语文句 ,但是你也可以问一个先问一个选择语文句 , 你是问选择语文句还是问一般语文句 , 这是基于你对这个孩子的水平的判断 , 你就降一级降两级 。

一般语文句他还是就选择语文句答不出来 , 你就问一般语文句 , 答不出来你让他想 , 你给他提示 , 给他提示之后你让他跟读 , 你带他读 , 读了之后再反过来再再回头 , 然后再慢慢的回到这个这个知识点应该去学的这个这个水平 , 就不断的帮助辅助他 , 把一个比较掌握的不是很好的这样的一个知识给掌握掉 。

类似于这种其实挺多的 , 比如说你要打一个比喻 , 做个比方 , 编一个故事 , 做个类比 , 比如说我我们学一个现一个语言现象 , 之前你学过这个 , 那这个跟他是同类现象 , 然后我得知道你之前学过这个 ,而且已经掌握了 , 我就用你之前掌握的这个 , 比如说比如说 com 变 came, 那 become 也是 become, 那 become 你不会变的时候 , 那 AI 外教能知道你之前 com 你学过

, 然后这个时候就会拿这个做类比 , 然后说提醒你 , 就我不告诉你它怎么变 ,但是我用之前的类比引导你自己去推理出来 , 这样你的记忆就更深刻 。

像类似于种种类似于这种比较细节的这种教学法 , 还是需要一点点的编织到这个模型能力里 。

然后还有一还有更难的一点 , 就是对难度的控制啊 。 您说您您说那个编织到模型的能力 ,其实是呃 , 训这个呃 , 专用的这个模型的过程当中, 对吗 ?

修佳明30:57

就是给他很多的示例 , 然后就命名说这个是什么什么样的 , 你你在什么什么场景下结合孩 , 怎么样根据孩子的特点去怎么做选择 。

申远31:07

模型不会到最后有点乱了吗 ?

修佳明31:09

有的时候会乱 ,但是就是得不断的在不断的不断的在调试 。

申远31:13

所以最后就是达到了一个你们觉得可用的一个平衡的状态 , 这这这是花了多长时间 ?

修佳明31:18

这个就是要花很久的 , 我们我们估估计了一下, 就目前我们的产能来看的话 , 我们要做一个新级别 , 做一个新课件 , 从设计就是我们确定了这个 25 分钟这课的主题 , 到它能够确定上线也就一年的时间 。

哦 , 就目前还需要一年的时间 , 就是我们现在在做的课要一年后上上线 。

申远31:38

那您刚才说那个更难的是什么 ?

修佳明31:41

更难的就是它对难度的把控 ,因为因为不同的阶段呃 , 这个难度的这个区间还是挺敏挺敏感的 , 挺细的 。

申远31:49

不可以给他规划一个词库吗 ? 就说你只能用这里边的 , 超超纲了孩子就听不懂了那种 。

修佳明31:55

啊 , 这种也有 , 这种也有 ,但是呢又不能那么死 ,因为我们还是希望这个这个 AI 发挥它的教学能力 ,因为 AI 有的时候确实会给很多惊喜嘛 ,而且有的时候孩子的语言也会超出我们的设定 。

有的时候孩子他就是会说一些说一些说一些话 , 然后那这些啊 , 比如说有一个孩子前两天我们刚看到的 ,他他是自己说出来的 , 说呃 ,他们去去那个呃 , 去美国玩 ,他说那个是什么 golden state 啊 , 就是这个东西是没教过他的 ,但他自己知道 , 然后呢 , 那也得接住啊 , 还得知道说这个是一个一个大桥 , 然后这个在哪 , 然后说啊 , 你去过这真好 , 然后再把它这

整个的课堂再再引导下去 。

申远32:35

所以它本身还是具有一些呃 , 世界知识的 , 或者说通识的那种知识的 。

修佳明32:39

对对 , 它的通识应该就是能够覆盖孩子所有的话题 , 就是孩子只要孩子感兴趣的 , 比如说有孩子说奥特曼啊 , 什么艾奥萨呀 , 还有那个什么蛋仔派对啊什么的 ,他都得都得会 , 像这种他都能他都得搭上能搭上话 。

申远32:55

对 , 那像这种难度控制 , 最后落地到比如说技术的层面 , 做了哪些技术上的优化呀 ?

修佳明33:02

这个就是其实花了挺多的人力的 , 就是还是在边界设定上, 我们会设定多条件的边界 , 就是在 A 条件下你是设定在那 ,但是如果比如说像刚才那种场景触触发了 B 条件 , 就是孩子主动说了 , 那你应该怎么样 , 然后结合这个孩子的水平 , 你你的你的呃 , 边界调整空间是怎么样 , 然后结合孩子的反馈 , 就你你说了一个词 , 孩子的反馈

懂或者不懂 , 下一步应该怎么做 , 就是我们会把这个条件设计的就就是比较密 。

申远33:33

但是这个但这个规则其实是其实是可以复用的 , 对不对 ?

修佳明33:37

是可以复用的 ,是可以不断复用迭代的 。

申远33:39

嗯 , 那呃 , 那那那那就是新课件的这种开发 ,其实还是可以用到的 , 对不对 ?

修佳明33:44

但是都得微调 ,因为我们那个孩子学习过程当中 ,他的水平是要不断的提升的嘛 , 所以这个模型要根据这个孩子不断提升的水平 ,不断的去修改自己的这个边界范围啊 ,其实是越来越往上越往上提 。

申远33:58

其实刚才我就想问 , 就是感觉这个孩子的这个好像比较难弄 , 为为什么不一开始搞一个 , 比如说成人商务应用 , 我觉得那个好像触发的条件会少一点 。

修佳明34:07

呃 , 首先就是因为我们是一直做儿童教育的嘛 , 然后其次就是我觉得成人口语说实话 ,有点相对来说需求更更更低 。

申远34:16

啊 , 需求更低 。

修佳明34:17

对对对对 , 成成人成人口语需求更低 , 它太场景化了 , 就有一些真的真的他需要学商务英语的话 ,他去线下报个班 , 对于成年人来说啊 ,他是能控制的住的 。

嗯 , 然后用这种模式 , 对于成年人来说 , 学英语我们还没有想清楚 , 就他是不是合适的效率 ,是不是足够足够高 , 然后是不是适合成年人来来学 。

申远34:40

对 , 这这就这就回到了其实下一个问题 , 就是我看咱们这个一次的这个一个级别的这个课程 ,其实长达一年的时间 , 然后咱们其实现在目前有六个六个级别 , 涵盖了大概是 6 到 12 岁的这个年龄段的对应的水平吧 , 可以说 ,因为我确实没有上过这种更多的课 , 为什么会设计的感觉好像很长 ,而且跨越一年的时间这样一个周期 。

修佳明35:01

因为口语能力提升就是见微知著的 , 它非常的慢 , 就是我的口语能力如果要提升一个台阶 , 真的看到一个效果 , 嗯 , 还是还是很慢的 。

它一开始会稍微快一点 , 我们看到孩子表现也是 , 就是起可能第一个月是比较快的 ,因为他进入状态 , 从不太不太熟练 , 然后到这个对这个课熟悉了 , 然后敢于开口了 , 一开始进步比较快 , 那后来后面就会一个台阶一个台阶的 , 一段时间他就会到一个平行期 , 过了之后又会比较快的迈一个台阶 , 然后遇到一个平行期 , 就是一个一个台阶一个台阶这

样的上 。

申远35:34

这个平行期大概是多长时间会出现 ?

修佳明35:37

这个确实是因人而异 ,但是我们看基本上也是在三个月左右 。 哦 , 对 , 就是大概你过三个月就会遇到一个平行期 , 然后你熬过去两周或者是一个月 , 最长的就会就会又开始突飞猛进 , 然后再进步三个月 , 可能又要到一个平行期 , 就孩子确实会表现出这种这种状态 。

情绪价值35:54

申远35:56

我看了咱们产品的那个演示的有一个视频 ,其实有一个场景有有一点印象深刻 , 就是首先就是孩子呢 , 回答的有点天马行空的 , 然后呢 ,AI 呢 , 它又是一个虚拟的东西 ,他们同时呈现在这个屏幕上的时候 , 好像它有一种张力 , 就是好像你在看一个科幻的东西的情节 , 好像这个这个产品怎么哎 , 好像突然变成了一个 , 它是一个呃 , 可靠的那种

产品了 , 它突然有一个那那种张力 ,在我看这个产品演示的时候 , 然后下一个场景就是我看到那个外教在问 , 呃 , 说啊 , 你给我形容一下你的妈妈长什么样子 , 我可以给你画一画 , 然后就是说有什么眼睛大小啊 , 什么穿穿的衣服是什么样子的什么的 。

我觉得这个部分的这个设计有点超出我的那个想象 , 就是说这个东西还居然能用用用出一个好像有一个花样的这个东西出来 , 这种花样还挺还挺多的 。

对对 , 就是您还有别的 , 哎 , 我先确认一下, 这个东西它是也是基于这个大模型的能力吗 ?

修佳明36:53

不是 ,不是 , 现在还不是 , 我们未来预期希望希望能做到 ,而且现在局部已经在尝试做这做这种 , 就用 AIGC 的能力在做课件了 。

嗯 , 就实时的实时的在生成课件 , 就是孩子们在互动的过程当中 ,他会试试 。 对对对对 ,但是现在因为有一些技术瓶颈嘛 ,其实主要还是底层的瓶颈 , 所以这个实现起来不不是很不是很容易 。

申远37:13

您说的底层的技术瓶颈 , 就是渲染太慢 , 生成太慢 , 就孩子们等不及 。

修佳明37:18

对对对 , 你不可能我现在说我想跟你聊一下奥特曼 , 然后我再画了 5 分钟的奥特曼 , 对 , 或者是对对对 , 你肯定是当场就出现才会才会比较好嘛 。

这这一块确实目前还是做不到说实时生成课件 ,但是我们会用一些策略和逻辑 , 做一些灵活性比较高的可组合性的这样的课件给到孩子 , 就挺惊喜的 。

比如说那个画妈妈 , 那个孩子的表情就是非常的镇静 , 就是画出来好像还挺像的 。

申远37:42

但是那个外教问孩子像不像的时候 , 孩子说 no 哎 ,但是他的表情表情对啊 ,因为很很多孩子可能看的不是一个 ,因为我看的时候我有点想说这个如果是就像您说的 ,他在长远来看 ,他如果能借助更多的这个 AI 的能力 , 好像还蛮还蛮还蛮惊喜的 。其其实我还看到咱们那个产品里有很多的那个动效 , 就是比如说给孩子一个礼物 , 然后砰一下, 那个

整个页面上充斥着那个礼物的那种动效啊 , 彩蛋是吧 ? 这个就是其实也是基于那种教学法的东西设计的 , 埋在那个里边 , 用来促进孩子的这个兴趣的提高的 , 对吗 ?

修佳明38:21

对对对 , 这个彩蛋是真彩蛋 , 就是得是随机触发的 ,而且不是随机触发的 ,有一定策略的去触发的 , 就孩子必须得聊到那个话题 , 聊到相关话题 ,在合适的时候 , 这个 AI 才会掉出这个彩蛋 ,不是每个孩子都能遇到 。

比如说有一个给生日礼物的这个彩蛋 , 那个我印象非常深刻 , 就是那个老师问孩子你想不想做 party, 你过生日想不想办 party, 然后那个孩子说 can I say no, 就是我能说不吗 ?

然后那个老师说当然了 , 就安慰了他一下, 说但是呢 , 你你不办 party 我也得给你个生日礼物 ,因为那个孩子情绪稍微有点低落 , 然后就就给了他一个彩蛋 ,他看了之后就还是很开心了 , 就比较自然 ,而且情绪价值好像还蛮高的 。

申远39:01

对对对对对 , 我们这种所所谓的大人, 有的时候会好像很难跟小朋友的那个路数同频 。 我特别想知道 , 咱们在呃 , 这种针对儿童的这种产品的过程当中, 有鉴于 AI 的不可控性 , 怎么应对那种比如说熊孩子问题啊 ,他就是不好好回答 , 或者说他就是有点好像挑衅 。

对对对对 ,其实有些有有的时候会出现这样的问题 ,不知道您是在产品的过程当中是怎么考虑这件事 。

修佳明39:29

是的 ,因为那个孩子年龄相对大了一些之后 ,他是会有一些自主意识的 , 然后会跟 AI 进行一些这些呃 , 就是 battle 所谓的对对对对 , 我们我们其实预期了有这样的情况 , 所以对 AI 也是提醒提前做了一些界定了 。

就比如说当孩子说到与这个课程课件关系不大的问题的时候 , 你应该怎么应对 ,在两轮之内要回归这个课件 , 如果太远的话就不做 , 就回避 , 就不做不做答复 。

如果是比如说那种涉及到敏感词啊什么的 , 就不做答复 , 然后如果是他偏题太远的话 , 要严肃一点的说我们我们在上课 , 用一些比较简单的有趣味性的任务去把他的注意力拉回来 。

但实际上在就是我们测试的过程当中, 实际上出现这种情况的孩子还是特别少的 。 而且有一个有一个情况就是呃 , 这也是常识了 , 就是孩子学这个需要学很久 ,他不是只上一节课 ,他要学几十节课 , 所以他的当他上到第四第五节课的时候 ,他对于这个跟 AI 模型 battle 也好啊 , 调戏他也好 ,他也没有动机了 , 就不新鲜了 。

就这个事情对于孩子来说 , 对于大大多数孩子来说 , 可能从第一节课开始 ,他都没有说特别在意这个 AI 的事情 ,AI 的事情 ,因为他他们早都用过那个大语言模型了 ,他们像这些事情早就跟那个 DeepSeek 啊 ,Dolby 啊他们都聊过了 。

对 , 所以在这里面其实是一个非常紧张的一个学英语的一个状态 , 非常紧张的学英语的状态 。 是是是 ,因为因为但是他他他他比真人教学当然是 , 或者是跟真的外国人说话当然是已经轻松非常多了 , 这个我觉得也是 AI 外教的一个很大的优势 , 就会降低这个这个情感的这个过过滤阈值嘛 。

但是他说英语他肯定紧张啊 ,因为毕竟是第二语言 ,而且他要一直输出 , 一直输出一节课 25 分钟要说 100 多次 , 就张嘴会说 100 多次 。

对对对 ,而且是有效的 ,有效的输出要说 100 多次 , 所以对于孩子来说 , 这个 25 分钟强度是非常大的 ,他也跟着跟着 ,因为那课件也是有有剧情有设计的嘛 , 一个小任务一个小任务 , 一个环节一个环节 , 过关斩将这样的 , 所以他他的他的情绪应该是是比较紧张的 , 就是一直能够聚焦在这件事情上 。其实我之前看到咱们的产品的时候 ,有一个介绍就说您

AI人格41:38

修佳明41:42

刚才其实也提到了 , 就是说这个老师好像有一种所谓的情感互动能力 ,他就是人格上非常的 nice, 比较就比较温暖 。

同真人教师相比 , 这个是我个人其实特别好奇的 , 就是这种超温暖的这种人格 ,在我们在做产品定义的时候 , 为什么会导向这个方向啊 ?

这个也是跟学习规律有关系的 , 特别是外语学习啊 , 还是跟跟外语学习有关系 , 特别是在外语学习口语的交际的这个环境下 ,其实他本身说语言就很陌生了 ,他压力很大 , 所以我们要想尽一切办法 , 让他处于一个非常舒适的自在的没有压力的 ,而且愿意主动表达输出的这样的一个环境 。

我们就想尽办法去营造这个环境 , 就让他在这里非常自由自在的 , 说错了也没关系 ,不会有人批评他 , 然后也没有人监督他 ,他可以畅所欲言的来表达 , 只要用英语就就没问题 。

就这个环境 , 我们觉得对于英语学习来说是非常关键性的 。 嗯 , 这也就是为什么我们要把这个 AI 的性格设计的这么好 ,但是好本身不是目的 ,他目的还是让他学习 。

所以所以其实是我给他们定义说这个 AI 外教有一个人格的 , 这个人格并不是说他的性格 nice, 或者是说他他对你一直都非常的耐心 ,而是而是说在孩子眼里 , 这个 AI 的外教是有人格的 , 就孩子会对他形成一个认知 ,他会在孩子的心里会建立一个图示 ,他是特别的 ,他既不是老师 ,他既不是真人老师 ,他又是一个老师 ,他到底是什么 ,其实现在可能没有一个准确的

名 ,他只是缺缺一个名称 ,但他的位格已经有了 ,他的他的人格已经有了 。 就孩子他在孩子里是孩子的那个认知里面 ,他是一个不一样的 , 处于一个不一样位置的一个存在 , 那这个存在对这个孩子会有一套稳定的特定的反应机制 , 孩子能够比较安全的知道我说什么话 , 大概这个人有什么反应 。其实这个就是我们理解每一个真人也是这样理解的 , 就是我我们

跟一个人熟了之后, 我知道我的朋友在某些情境下会给我什么样的反应 , 所以我跟他做朋友 , 这个这个他在我的这个呃认知里是有人格的 ,其实跟这个外教的关系是一样的 。其实有一个问题我没有写在提纲里 ,但是我觉得我们都说到这了 ,AI 老师他其实好像有独立的这个位格 ,但是呢他又不是真人, 我们好像我们目前人类的这种语言的体系里 ,

或者说概念里 , 好像很难界定出一个有独立位格却不是人类的那种东西是是个什么样子的 。 这这种在这个产品中置入一个这样的有独立位格的这个东西 , 会不会有一种容易让人模糊一些界限的感觉 ?

因为我们知道 , 举一个不不这么恰当的比较浅薄的例子 , 就是呃现在的小朋友们其实看到任何玻璃都想去摸 ,因为 iPad 是他们的学习机什么的 ,其实都是触摸式的 ,他们好像天然觉得反光的东西什么的 , 玻璃这种东西都是可以摸的 ,其实就是这是某种程度上的一种好像界限的模模糊 。

那这个 AI 老师的这个他他当然更复杂了 , 对不知道这个问题您是怎么看的 ? 我觉得这个是一个自然形成的结果 , 就是我们并不是说我们做之前其实没有考虑这个问题 , 只是想怎么用一个产品把口语这个学习的事情做好 。

但是完成之后, 也是通过观察孩子们的反应 ,以及这个 AI 外教真实的一个表现 , 我们才发现确实出现了一个这种状态 。

嗯 , 所以所以在跟很多人交流的时候 , 我我就会举例子说 , 呃我们不希望说这个 AI 外教有百分之多少像人 ,因为我们做的时候就没把它往像人的做 ,因为用的二二维动画嘛 。

嗯 , 然后嗯 , 这就是像我们从来不会说狗是人一样 , 我们不会说一个狗有多少像人, 狗就是狗 , 狗有自己的一个在世界上的定位 ,其实就是这样的 , 就是一个孩子 , 你小朋友其实还在这个泛灵论的这个阶段嘛 ,他可能看到小汽车 , 看到一个公主 ,有养娃娃都会觉得他是在一定程度上有生命的 , 虽然他是一个呃物体 , 对 ,但是在他的这个认呃世界观里 ,他的意识里

面他在一定程度上是有生命的 , 所以每一个课题他的生命性是不一样的 。 比如狗 , 如果是我家养的宠物狗 , 我我我就会觉得他他是很有人性的 , 就他身上的人性是比较多的 , 我会跟他说话 ,也会跟他建立一个情感关系 ,但是我又完全不会误会说他是人。

对 , 然后我觉得呃 AI 外教的出现嘛 , 就提供了一种在这个之中一个新的点 ,他只是一个点 ,他他提供了一个新的位置 。

那孩子我们都叫他们是 AI 原住民 , 就对他们来说可能没有那么难接受 , 嗯 ,他就是一个点 , 然后可能别的他又看到别的 AI Agent 或者是其他又是一个点 ,在他们的那个认知体系里面 , 只不过又是一种新的存在形式而已 ,有一定的人性 。

那这个这个人性其实是通过他的反应在这个交互过程中建立起来的 ,他不会误会他他他是人。

申远46:34

对 ,其实让我想到了 , 就是很多当当然中国比较少的 , 就是外国的小朋友 ,有的时候有那个非常流行的那个视频合集 , 就是当小朋友第一次被告知圣诞老人是假的时候 ,他们崩溃的那种那种样子 , 那个好像就是一种就是所谓的他的那个某种东西的一种消弭 , 对孩子的 。

修佳明46:52

对对对 , 就是成长过程当中就会毕竟是落实物 。 对对 ,但是我们这个其实不涉及那个问题 ,因为一开始就孩子也知道他他他就是假的 ,也不是假的 ,因为他不没有真假 ,他不是假人。

对对 , 定位就不是假的嘛 。 对 ,他不是假 。其实这个对这个问题我还是就是因为他好像也跟特别是口语的学习 , 我觉得非常有意思 ,因为他特别强调互动 , 然后人在互动的过程 , 人作为一个人 ,他的这个互动过程当中就会产生很复杂的东西吧 , 就是不只是语言了 ,他是会有一些更多的东西 。

我觉得我们今天虽然这个产品是呃技技术导向的我们 ,但是其实我觉得他还会诞生一些更怎么说 ,也不也不是说社会性的吧 ,他好像就是说有一些更更更多的意义在里面 。

是是是 , 会引发一些呃伦理的思考 。 呃对对对 , 就是其实呃对 ,也特别是口语吧 , 口语这个互动性有的时候 ,因为我在想 , 如果是我在比如说很小的时候 , 一开始接触第二门语言的时候 , 那可能很难想象我会怎么样去理理解他 。

反馈与评估47:37

修佳明47:53

那说到这了 ,其实呃咱们这个内测阶段的这个用户的数量样本啊 , 数数量修老师有没有什么数据啊 ?

我们一共现在是测了 7,000 节课 , 然后最多的用户就一直跟着我们上的 , 已经完成了 26 周半年 。 对对对 , 最早的最早的一批测试用户已经已经是半年多了 , 然后那个一共上了一共上完的有 7,000 多节课 。

对 ,在这个过程当中, 嗯 , 内测阶段的用户有什么您觉得非常重要的反馈 , 或者说有什么比较重大的迭代吗 ?

跟您最开始产品定义的时候 , 嗯 , 重大的其实没有 ,但是局部的细节的非常多 , 就因为每一节课我们都会拿过来去看那个地方 , 让您比较印象深刻的呢 ?

您觉得呃最近吧 , 可能最近的印象比较深刻 , 好像就是有一个有一个孩子 ,他在教师节 9 月 10 号拿了一个贺卡 , 嗯 , 还有花 , 然后去去跟 Jessica 说那个祝你教师节快乐 , 就送给这个 AI 老师 。

对对对 , 然后呢 , 这个 AI 老师反应有点淡漠 , 哈哈哈 ,有点冷漠 。他也他也他在语义上没问题啊 , 就是那个那个表情也是笑的 , 这个都没问题 ,他的反应是正确的 , 就是笑着说谢谢你怎么样 ,但好像就是不激动 , 没有那种爆炸式的感动 。

然后呢 ,但是那孩子给给拿礼物的时候 , 那个就是已经营造出了一种全面的氛围 。 我们看到的这个就意识到这一点 , 应该是我们的一个疏忽 , 就是在前期前期做设定的时候 , 就是这个设定更多的是模型层的还是策略策略层的 , 就是就是我们嗯也也是因为这个产品还是比较早期嘛 , 就是我们没有对那个自然自然日历的关键节日做一些特殊

设定 , 所以我们就回头马上就把这个加上了 , 就是在教师节在马上要的 , 比如圣诞节 、 元旦 、 春节 , 还有中秋和那个端午 。

申远49:44

但不是预设他是超温暖人格吗 ?

修佳明49:47

对啊 ,但是他也挺温暖的 ,他就是没有没有在当天意识到这一天是一个特殊的节日, 就他没有爆炸 。 对 ,他他还是他还是笑的 。

申远49:55

但是如果是一个比较平静的小朋友来说 , 教师节快乐 ,他其实就这个反应就是对了是吗 ?

修佳明50:01

嗯 , 如果是孩子主动说出教师节快乐这件事情 , 对于 AI 外教来说应该是一个非常大的鼓励 , 所以他作为一个这个性格的外教应该是给一个至少给一个彩蛋 。

申远50:12

但是其实这个策略是我们设计出来的 。

修佳明50:14

对对对哦 ,有很多其实就是我们需要模拟模拟这个对话者的意图 、 心态 、 设定来去做一些预先的这个这个设计 ,但他具体说什么话我们管不着 。

申远50:24

大模型在这方面不能起到一些作用吗 ? 就是说我们的就是直接基于他模型能力生成出来一些反馈 ,他在语言生成上是是没问题的 ,他在语言生成上是是完全自主 ,而且是在我们的规定范围内是很恰当的 。

但是我说的那个反馈就是他不依赖于语言模型 ,他的语言没有问题 ,他的他的状态性格就是没有给一个彩蛋扔出来 ,因为因为这个 AI 外教还需要有动作嘛 , 动作也是结合语言去去调动的 ,他配合的也挺复杂的 ,但当时他没有做出那种最夸张 , 就是没有把这个反应设计成最夸张的一套 。

哦 , 我原本以为这个老师的某些反应之类的东西 ,他是更多的会依赖于模型 。

修佳明51:03

平时是这样的 。

申远51:04

哦 , 对对对 ,因为我我想如果这种还要非常奋力的写规则的话 , 那要写的规则是不是有点太多了 ?

修佳明51:10

其实其实不多 ,其实大部分都是场景 , 就是我们只是会教给这个模型一个场景 ,但是像这种我们是想保证的 , 就是我们也不能说 AI 一定不行 ,但是我没法预测说他一定这么激烈嘛 ,但是我们的判断是这一天如果有这种情况是一定要激烈的 。

所以像这种我们就是确定必须想让他做反应的 , 还是会加一点加一点策略外挂的东西 。

申远51:31

还还有别的吗 ? 比如说内测阶段的用户的反馈 。

修佳明51:34

也不能说反馈 , 比如说最开始的时候 , 第一版的时候有一个小朋友 , 当时我们可能就是对 AI 的这个严格度调的高了一点 ,有句话读不过去就读了五遍 , 就是差点都哭了 , 就是崩溃了 , 然后 AI 孩子崩溃了 。

对 , 就 AI 很耐心 , 就带着他读 , 就是冷漠的耐心 , 就是一直在重复 。 对对对对对对 , 这个是我们觉得是非常糟的嘛 , 然后就就针对这个又做了很多的一个调整 , 包括轮次的限制啊 , 包括像我们说的教学法的不断的去加强 , 怎么引导他先说熟悉的短的 , 甚至换语言材料带他去完成任务 。

申远52:08

那像我们最后在内测阶段这个衡量他的这个教学效果 , 我们用了一些什么样的量表或者是什么之类的吗 ?

修佳明52:15

我们内部其实围绕着这个产品 ,其实构建了一个叫口语力的指标 , 然后它分成了口语表达的准确度 、 流利度和丰富度三个大的维度 。

每个大的维度下面有两个小的维度 , 每个两个小的维度下面都是有一些客观数据的指标聚合的 , 然后我们是有公式 , 就每个每个小的维度有公式 , 最后在一个大的公式再转化一下, 做一个函数 ,其实比较简单 ,但是但是做了个长模之后, 呃现在快上线了 , 就是应该会比发布的这个时间稍微晚一点点 , 就会发布这个口语力的这个体系 。

申远52:46

所以用户也能非常直观的看到这个提升的程度 , 对不对 ?

修佳明52:50

对对对对对对 ,因为这个课的语料是很大的 , 一节课就 25 分钟 , 孩子要说 100 句话 ,其实一节课从估个差不离 , 如果他上了四节课 , 基本上能估的比较准了 , 用这个这个模型 。

所以这个这个是我们未来将会看的一个指标 。 早期我们其实看一些比较粗的指标 , 比如说 25 分钟内的有效开口次数 , 那这个进行一些对比 , 然后比如说呃 100 次以上 , 我们就觉得是很合理的 ,因为一分钟要出四次完整的表达 , 这个强度就就还是蛮大的 , 能够完成教学目标 。

申远53:19

最后是不是还是需要考试才能看出来他的进步程度 ?

修佳明53:22

其实口语不太需要考试 ,因为他在这个一节课 25 分钟内他就是要说这些话 ,而且你他没有什么拐棍哦 , 除非他不会 ,他不会老是可能会有一些有一些帮助他的地方 ,但是他就得凭空说说这些话 ,其实每一节课都是一个考试 , 就能测验的 。

然后如果是想要验收验收成果的话 , 我们在 L4,L4 的水平其实我们是要交付 KT 水平的 , 所以在 L4 我们会赠送很多的 KT 模考 ,KT 口语模考 , 赠送模考竟然对 , 就是赠送的 , 你不考也行 , 这不是课内的 , 这就是真正的彩蛋吧 , 就是小朋友突然收到了模考的试题 。

对 , 就是因为你可以不管是任何学习还是得交付成果的嘛 , 所以你如果对对我们自己的这个口语力的体系不是非常的有信心的话 , 就可以去外部的考试去测验 。其实我第一次看到咱们这个口语课的时候 , 我有一个我有个最大的疑问 ,因为我们其实把产品的这个部分现状的东西 , 我觉得我们已经聊的比较那个什么了 , 接下来我们可以能聊一些未

来的东西 , 然后聊一些商业化的东西 。 呃那呃在在这个阶段 ,其实就有一个我一开始就有的问题 , 就是为什么这个课程是不能复用的呀 ?

呃是指就是说我可以一节课反复学啊啊 ,因为我我其实还专门跟咱们的老师们确认了一下这件事情 , 我觉得这个真人外教很难找嘛 , 所以我要找 AI 嘛 。

对 ,但是 AI 的老师好像也给我一只有只有一次机会 , 这个事因为我我我不是搞这个 , 对 ,但是我就觉得这个事好像对我来说挺奇怪的 , 就不知道是为什么 。

这个主要是因为我们判断不需要 , 就是没有这个再学一遍的场景 , 就是不需要有这个场景 ,因为因为我们一个主题其实有四节课嘛 ,有两节对话科 、 一节表达课 , 还有一节综合运用课 。

那个综合运用课其实带着一点复习的性质 ,是把前三节课的能力和知识又重新的用一个连贯的剧情 , 让孩子在做任务的过程中再复现一遍 。

然后呢 , 我们还有呃搭配的预习复习这种课外的环节 , 所以其实只要这个孩子上完完整的上过一节课 ,其实不再存在他再上一遍的需求 , 就是我们也不建议他再上一遍 , 就不想不想让他再上一遍 , 就浪费时间 , 就浪费孩子的时间 ,因为 25 分钟对于孩子来说挺难得的 ,而且一周两次对他们来说也是一个极限了 。

对大部分家庭来说 ,因为他不只是要学英语嘛 ,他很多的科目啊 , 很多的项目要做 ,其实能抽出两天 , 每天 25 分钟来专门说英语口语就够了 ,而且很不错 。

那这个情况下没有必要再同样的课再上一遍 ,因为他已经上过了 ,他没有必要同样的课再上一遍啊 。

而且这里面涉及到的所有的单词也好啊 , 句型也好啊 , 对话能力也好啊 , 我们都是会循环复现的 。

就是在这个过程当中, 比如说我我这节课我已经学了一个将来史了 , 然后我可能四周之后还会再学将来史哦 , 可能稍微难一点点 ,但是都会基于你已经学过的这个 ,在这这个基础之上再进行 。

申远56:14

就是您说的那个教学体系的节奏 , 对不对 ?

修佳明56:16

对对对对对 , 你不会说你当当场有点遗憾 , 你非得在当场就一定凿实 , 这个这个从教育的角度来说也是不太合理的嘛 。

就我们就是很不建议这种重新上课的 , 呃所以也就干脆就不开这个这个口了 。

未来与壁垒56:28

申远56:29

咱们还是继续谈谈未来 ,其实刚才我们稍微聊到了一点 , 比如说在这个产品里边接入这个 AIGC 的能量什么之类的 ,在您看来 , 首先是这个产品本身未来会怎么演化 , 除了更多的课件之外, 呃这是其一 ,其二就是它跟本身的这个 AI Agent 的 , 或者说大模型技术的这个发展之间是一个什么样的关系 , 您是怎么看的呢 ?

修佳明56:50

我们现在首先确实需要先把这个课件的数量 。

申远56:53

啊对 , 这个我知道 , 对 , 完成 ,因为因为这不仅是数量的问题 , 更高级水平能不能胜任 , 然后更低水平就是基础更差的孩子能不能使用这个功能 ,其实我们都还需要验证嘛 , 特别是基础更差的 ,因为基础更好的我们觉得还很有信心了 。

嗯 , 这里面还是需要大量的投入在里面 , 然后如果是畅想一下的话 , 我觉得你就实时生成课件这个事情 , 如果能做到就会是一个很大的突破 。

嗯 ,因为孩子的想法确实有的时候是天马行空的 , 然后大模型的能力也很强 , 仅从语言交流来说的话 ,他们能做到的事情是非常多的 ,但我们现在还是相对来说比较限制 , 嗯 , 还是要依据我们的设定好的这个课件和课纲来做 ,但实际上大模型是有能力进行这个这个针对性的教学的 。

但是又又说回来是因为是儿童学习嘛 , 如果这个课程就是枯燥的一个一个脸对着一个脸 , 这个课是进行不下去的 , 一定得有素材 , 就他们一定得有这个课件的支持 。

那这个课件如果是由 AI 能够实时生成的 , 根据这个孩子的兴趣点和当天的这个话题当场画 , 比如说画妈妈就真的就画的更像 , 然后他又能调取很多的呃很多的数据来形成这个课件 , 那这个教学效果应该是会呃又应该是会更好的 。

还有还有一点就是呃我们现在整个的对话的实现的方式 , 我觉得也有也有改进空间 ,也有优化空间 ,但目前嗯技术还是不太行 。

您觉得技术还是不太行 ? 您觉得技术主要的问题是在哪里 ? 目前我们我们还是先要识别那个孩子的语音 , 然后转成文字 , 然后模型理解文字 , 模型产生文字 , 然后模型通过文字 TTS 产生语音 , 对 , 中间是是这样的一个 。

哦 , 您是说它不是原生的多模态的模型 , 还是一个文字模型是吧 ? 对对对对 , 然后这一点确实是在这个场景下还是还是做不到的 , 还是做不到直接用那个原生多模态模型 ,因为我们有教学要求 , 比如说我们需要让孩子这句话说的不好的时候 ,他的说的原话打在屏幕上 ,他能看到自己可视化自己的口语输出 , 然后那一个词说的不精准 , 直接

就给他标出来 , 替换成精准的词 , 老师再再重读一遍 。 那这个当然真人外教很难做到这一点 , 然后也是 AI 外教的一个优点 。

那这就需要我我们优先对他的语音进行识别和转文字 , 然后所以这个跟教学也关系 , 跟教学有关系 ,但是现在还是有少量延迟 。

那这个延迟我们评估了一下 ,其实跟那个正常网络状态下在线真人外教跟孩子说话的延迟差不太多 , 这方面体验倒没有更差 ,但是其实还是能做更好 。

就像这些细节 , 我觉得看起来很小的细节 , 就是其实就是 100 毫秒左右 , 人是很难察别的一些一些 ,但是呢还是得需要底层技术再再发展才能够支持 。其实我看到咱们那个产品的时候 ,因为它是个主动式的 , 基于这个 Agent 的 , 像您说的是全栈的 ,但是在我理解可能主动这个点对我来说更重要 。

刚才其实也问到您对这个技术的看法 ,其实我们知道在您这个赛道这个场景它是教育嘛 ,其实有很多的时候有一些广泛的争论 ,在模型上构建的这个产品 , 很多时候它会随着模型能力本身的进化 , 它就被冲掉了 。

我们过往其实看过很多这样的例子 , 比如说一开始这个模型好像只能处理文字 , 那有很多的人在上面加了一些工程化的能力 , 然后它变成这个产品 。

但是比如说 OpenAI 的一个新的发布会 , 它这个模型能力本身大幅提升了 , 这个 Agent 也是这样子的 , 比如说自主的编制 Agent 的这个方法 , 甚至是基于这个模型本身就能用一些自然语言的 prompt, 它其实就能很容易的编制一些呃这种 Agent 的东西出来 。

咱们这个产品是收费的嘛 , 这个就是其实就是涉及商业的这个部分了 。 您会有这个担心吗 ? 说如果比如说模型加速进化 , 或者说加速普及了之后, 制作这个 Agent 的这个门槛就更进一步的降低了 , 然后这样子会造成比如说对咱们的这个产品本身的 ,不管是它的定位也好 , 它的价格的冲击也好 , 您怎么看这个问题 ?

修佳明1:00:33

我我还是比较期待这个模型能力大幅提升的 ,因为我们也是跟的很紧的 。 如果有提升的话 , 我们在这个需求的这这一块可能也会动作会更快 ,因为我们积累的经验啊和就是呃积累的一些数据也是更多一些的嘛 。

儿童教学这块其实确实跟其他领域不太一样 , 我也想了一下, 大概就是医疗教学跟 AI 的结合 , 可能跟其他领域都都不太一样 ,因为它涉及很人命关天的事情 , 特特别是说教学这一块 , 没有办法一蹴而就的 。

就是你告诉模型不就这个模型 ,不管它发展的再好哈 , 它总归是要基于人类的数据的 , 然后基于过往数据 。

但是关于教育这件事情 , 数据没有经验更有说服力 。 你不管是从任何的渠道拿来的数据 ,是从网上拿来的数据 , 从各大企业拿来的数据 , 从学校拿来的数据 , 你没有办法用到面对这个孩子的时候 , 你应该怎么教他说英语 , 用不上这个事情 。

里面的经验和人力的比重是特别大的 , 仅限于这这个这这段哈 , 这件事情 。 那比如说成年人学习可就不一定了 , 就有可能你学商务英语 AI 完全你就告诉 AI 完全对 ,其实我完全 ,但是但是对对对不行 ,因为它它还是很很精密的 , 比如说先学哪些词 , 后学哪些词 , 哪些能力应该怎么怎么发展 , 这些不能让 AI 随便的去发挥 。

对 , 这这一点也是我们在做的过程当中去感感受到 , 感受到这一点 。

申远1:01:54

这是不是构成了一种张力 , 就是这个大模型的能力边界和要控制它的那种运用的那种东西 ?

修佳明1:02:01

对对对对 ,其实就像汽车 , 你也可以开很快 , 就是原原则上来说 , 你可以开非常非常非常快 ,但也不能让你法拉利的汽车在大街上跑嘛 。

对 ,其实是一样的 , 就法拉利的汽车可以在大街上跑 , 就是说你是说不不能那个赛级的那样跑 。 对对对 , 你不能畅放开了跑嘛 , 对吧 ?

你还是要注意到这个人人的需求 。 嗯 , 就是所以我们在看待产品的时候 , 还是我我们不也不觉得所有的教学场合 、 学习场学习的场景都适合像斑马口语这么做 。

就我也不觉得所有的场合都是都是有可能实现的 。 但是就这个需求来说 ,也你也说了 , 就是对话这个事情是很微妙的 。

嗯 , 就这个需求来说 , 还是短时间内看还是需要人的强干预的 。 而且这个课件除非那个像我像我们刚才聊到的 , 就是 AIGC 的这个能力蜕变了 , 就是进化了能够实时生成课件 , 那这个对于我们来说是非常好的消息 。

我们就把我们现在课件全都取消了 , 我们肯定会很快的去做那个产品 。 对 , 除非是这样 , 那不然我们这个课件就是就是学习的一个一个壁垒 。

申远1:03:01

是是不是可以理解为这是一个就是护城河的问题 ? 您您刚才提到这些东西 , 我总结起来好像就是说是一种经验 , 然后这个经验就是很难被怎么说呢 , 很难在短时间之内很容易的被被拿走 。

是是是 , 这这是基于咱们斑马一直以来的这种对于儿童教育的这种研究积累下来的东西吗 ?

修佳明1:03:20

是是是 ,因为我们一直对全年龄段的儿童进行比较细致的这个观察和研究嘛 ,也是也是一些实际的工作中的经验告诉我的 。

比如说我们招聘教研老师 , 或者招聘一个产品来做这个参与这个项目 , 至少要培训两个月 , 一个人他只需要完成这个里面的一个环节 , 我们要想让他胜任的话 ,也而且他已经有教学经验了 , 都是英语很好 ,有教学经验这样的老师来我们这培训 , 至少要两个月才能上手 ,而且他只能胜任一个方面 。

所以现在包括我在内 , 没有任何一个人能够全盘的掌握这个产品的所有逻辑 。 所以这个东西哪怕我们所有的资料全部公开 copy 给另一个公司 ,也是很难做的 ,因为有一些东西看也看也看不懂 , 然后里面的里面的逻辑也也是也是非常的复杂的 。

定价与竞争1:04:05

申远1:04:07

下一个问题 , 呃 , 咱们的产品的定价策略 , 或者说这个付费的逻辑 , 修老师可以整个讲一下, 比如说付费的策略啊是什么 ?

修佳明1:04:15

付费我们确实也讨论过挺多挺多轮的 , 最后还是确定先按照级别来付费 ,因为我们还是从放弃了从一个 AI 产品的这个角度来看这个事 , 还是从一个学习产品的角度来看这个事 。

看了一下市面上口语学习这个产品大概的一个定定价区间 , 还有一个付费的一个习惯 , 觉得口语可能按一个级别一个级别的学是比较好的 , 对于家长和学生来说是比较完整的一次学习体验嘛 。

所以还是按照级别来付费 , 级别一个级别 3,600, 这个价格也是比较符合大部分用户的一个心理的吧 , 就是心理价位 。

申远1:04:50

就是对一个学习产品的口语产品的 , 对 , 就一年的口语产品的一个心理价位 , 我们是觉得定低了 , 我们是稍微觉得定低了一点 ,但是呢因为它是一个 AI 外教 , 嗯 , 就是这个东西很多家长也很难一下子非常的信任 , 对 , 就是还是需要到市场里去验证的 。

所以我们觉得就先不要让价格成为一个特别特别拦住很多人在使用这款产品的一个因素 , 所以就定了呃这个价格 。

推的过程当中, 家长们的不理解主要集中体现在我们在内测的时候 ,其实是打折卖的 , 打个七七折左右 , 对 , 大概 1,500-2,000 之内卖的 , 那个价位是没有什么人不接受啊 。

然后所以我们觉得 3,600 其实也还好 , 就是也调研了一下家长的这个预期 , 家长其实非常实在 ,他不关心你这个 ,不太关心这个是 AI 外教还是真人外教 , 或者是具体的形式 ,他只关心你交付给我什么样的教学效果 , 多少天给我一个什么样的学习效果 。

然后因为我们都有试听嘛 , 所以孩子自己会来试听 , 试听孩子会有反馈 , 就家长是比较在消费决策上, 这一方面还是很理性的 。

那您刚才说到了 , 觉得你们内内部也开过很多会 , 觉得还是把它一个当做一个学习产品来推 , 为什么 ?

修佳明1:06:02

因为它根本的起点还是是要解决一个需求 , 就解决口语学习的需求 , 所以它交付的结果也是一个口语学习的一个成果 , 就是可以理解为它还是一个跟你们之前做的这种学习产品的根本的逻辑是没有不一样的地方 , 对吗 ?

嗯 , 产品逻辑不一样 , 就是产品框架逻辑不一样 ,但是呢它的再高一点的概念层可能是一样的 。 嗯 , 就它就是为了解决一个问题 ,因为这个付费策略其实还蛮重要的 , 特别是我说的不是学习产品 , 我说的其实是 AI 产品 。

关于我们现在这个 AI 产品的这个付费的逻辑 , 包括这个市场潜力 , 付费的意愿什么之类 ,其实是一个怎么说呢 , 争论非常激烈的话题吧 。

有很多人, 比如说现在有一种比较主流的看法 , 就是觉得模型其实本身不值钱 , 构建在模型上的产品 , 然后能够形成数据飞轮的 ,有用户粘性的这个东西才更值钱 。

这其实就是涉及到一些对商业模式的理解了 , 对这个对 AI 产品的这个理解 。其实其实还行 ,因为因为那个同类竞品目前还没有 , 我们其实不太拒斥 , 还是希望更多的人来做这个的 ,但是还没有嘛 。

然后这个一个是说它的整个的产品形态非常的新 , 还有一个就是因为现在外教真的太难找 , 首先它的合法途径很少 , 线下的外教也参差不齐 ,但是大家学习口语的这个需求就是非常的强烈 , 所以这个需求至少在 10 万以内的这个规模内 , 我们觉得还是压力不大的 。在这个基础之上, 我们的预期空间还是更大的 。其实您刚才也说到了 , 这

其实是下一个问题 , 这种主动式的这种口语的产品 , 等于是斑马第一个做的 。 我们也知道其实包括斑马也好 , 包括整个的这个大的集团层面的园林科技集团层面的 , 呃 ,其实面对的竞争蛮剧烈的 , 可以说除了有同样的这种教育的品牌之外, 我们知道其实很多互联网品牌 , 互联网的公司其实也在呃布局教育的赛道 , 特别是这种所谓的软件产品

吧 , 就不是硬件的这种东西 。 您是怎么看待这种这种竞争的 ? 以及就是有的时候行业先发哈 , 大家觉得说这个是抢跑出来的 , 独独树一帜的 ,其实有的时候也代表了大家对这个赛道的一些犹豫 , 或者说一些吃不准的地方 。

您是怎么看这个问题的 ? 竞争也好 , 呃 , 斑马可以率先推出的这个东西也好 ,以及呃 , 或者是可以为我们对未来的这种竞争的环境做一些呃演变的预测 ,也就基于您的视角吧 。

好的 , 我就是还是结合我个人的在这个这款产品研发中的经验来看 , 之前也说我们觉得还是推出晚了 , 所以其实我们并没有在抢跑 , 我们一直在拖延 , 还是把这个产品做的非常的内部满意才推出来 。

所以那其他家的都是我们亲自做了才知道这个活太苦了 , 这个工作实在是太苦了 ,而且里面有很多很多被埋没的 , 就产品表面看不出来的东西你都得做 。

如果不做的话 , 可能会有怎么说 , 就是这个有效性 , 或者说它的呃可靠性可能会从 99.9% 降到 97%。 但是到 97% 就是不能接受的 , 就对一个教育产品来说就是不能接受的 。100 个人有 3 个人在教育上出错了 , 这个是我们做教育产品不能接受的 。

那这个百分之你看起来只有 3% 的这个工作 ,其实我们要投入特别特别特别大量 , 这不成正比的 。

所以这个投入其实从前期研发来说是算算账是不太好算的 , 从前期研发的这个投入上来说 。

而且虽然是 AI 很智能 ,但是我们目前这个阶段是要花很多死功夫和硬功夫的 ,而且还有反反复复的这个测验 , 这里面吃的吃的苦很多 。

所以我我觉得规模一般的公司是不太能做这种事情的 , 现在因为我们投入也很多 , 就光研发我们算了算投入两个亿了一次 , 所以这个规模一般的公司或者创业公司不太能做这种事情 , 我们不太担心这方面的竞争 。

然后同等规模的这个教育公司呢 , 这个就要看他们的决心 , 然后一个是看他们的决心 , 一个是看大家的就是教研的特长所在 。

比如说有些公司比较擅长数学 ,有些公司可能比较擅长语文 , 确实每每一家都有专长 。 斑马这边对英语确实是极度擅长 , 呃 ,有可能其他公司在 AI 的探索上可能会优先推出 AI 语文相关的产品 , 这个也是有可能的 ,但这个有可能不是由斑马来做的 。

因为在教育的这个行业里面 , 你对于一个一个方向的这个专业度 , 确实很影响这个产品推出的这个这个力度和能不能实现 。

对于非教育类的大厂来说 ,他们我觉得他们的眼光和他们的这个战略需要吧 ,在面对教育的时候 , 可能更想做通用型的工具 , 可能更想做一些在他们看来就是市场更大 ,他可能不会像我们花这么多精力做一个这么像钉子一样的一个东西 , 垂直下钻这样东西 。

因为我们最近也看到豆包会出现 , 会出一些教育相关的功能 , 我觉得做的还是蛮好的 , 就是在那个在比较高年级的批改啊 , 答疑啊这些方面 ,但是这些就是通用的基础功能嘛 。

而且这些功能我我们目前来评估所有的呃市面上的可见的 AI 结合教育相关的产品 , 科技产品 , 我们目前的观察都是可以平替真人的水平 。

我找一个优秀老师 , 只只要我找得到一个优秀老师 , 我是我也能平替 AI, 反过来说啊 , 两边都可以平替的一个水平 。

然后能做到平替优秀老师的这种工具已经属于非常好了 。 但是我们做斑马口语抓的点是老师平替不了 , 我们就是抓任何一个老师来 , 都无法完成一个一个 AI 外教能够完成的口语训练 。

对 , 我觉我觉得未来再做其他的 , 我们也可能会研发其他的教育产品 , 然后看能不能也是结合 AI 的一个技术发展 。

我们做也还是会坚持这这这个方向 。 如果这个事情老师也能做 , 人也能做 , 我们就不做 , 大概是做做这样的一个一个产品的方向 。

申远1:11:42

您刚才说的那个产品的开发的这个所谓的规模的这个优势 , 您能简单的介绍一下研发的这个团队的这个规模 , 或者说它是怎么样组成的吗 ?

团队与发布1:11:42

修佳明1:11:51

其实其实也相对传统 , 就是有教研 , 教研团队就负责整个的这个教学体系设计啊 , 然后教学法的一些输入啊 , 包括一些专专业知识的这些这些东西 , 然后有动画交互团队 , 然后负责设计整个课件的这个交互实现 , 然后这些是内容团队 , 然后有产品团队 , 产品团队就是负责产品框架设计嘛 , 然后研发 , 研发团队就是负负责整个

的这个产品的落地实现 , 然后我们还有那个音视频的中台 , 要负责整个的直播引擎啊 , 然后声音的这些东西 , 然后再和 AI lab 去合作 , 然后接入模型 , 然后做模型训练 , 然后还有其他的那些 , 比如说呃语音识别啊 ,TTS 啊这些的训练 。

然后在这个过程当中, 我们额外还有一个就是比较跨部门的标注团队和质检团队 , 这个其实主要也还是教研负责 ,因为是就比较专业的这个判断嘛 。

我们就是需要对所有的数据做标注和质检 , 质检之后还要再调优 , 然后我们这个我们这个产品还是还涉及到一个 , 我我们还会对每一堂课打分 , 就是因为我们之前的这个教学经验 , 呃之前我们会给外教打分 , 就你这课上怎么样会给外教打分 , 然后用同样的这些维度去给呃 AI 模型每一节课打分 , 然后这个课如果打分某一些维度是

偏低的 , 就会去迭迭代课程 , 就还有 。 所以我们内部有有一条就是平行的迭代线 , 就相当于是两个团队在做这个事 , 一个团队在前面做测试 , 测试完了另一个团队做迭代 , 迭代后的版本上线 。

申远1:13:18

这样的团队规模一共是多少人啊 ?

修佳明1:13:20

加起来大概有 200 人左右 。

申远1:13:23

好像这个开发的逻辑还是跟一般的这种产品还是差的蛮大的 。

修佳明1:13:28

大吗 ? 我们觉得其实其实除了那个标注量比较大 , 标注和质检量比较大 ,其他的都都还 。

申远1:13:34

标注您说标注的数据是什么 ? 就是呃不不是我们说的那个规则 ,而是那个教学的那个数据 。

修佳明1:13:41

对对对 , 我们看看还有什么刚才漏掉的问题有没有讲的 。

申远1:13:45

所以咱们是几号发布啊 ?

修佳明1:13:48

18 号 。

申远1:13:48

18 号 , 它是一个软件的形式吗 ? 对 , 然后它会那个快速迭代吗 ? 还是什么 , 就是那种版本的更新啊 ?

修佳明1:13:55

没有 , 现在只有一个级别 , 然后很快有两个级别 。

申远1:13:57

就是我就说那这个更新的周期是什么样的 ?

修佳明1:13:59

更新周期就是按照我们的这个研发进度在做了 , 大概一年上一个级别吧 。

申远1:14:04

哇 , 那你这个岂不是一个五年规划 ?

修佳明1:14:07

对对对 , 那那那现在上的第一个就是 level one,因为低低年龄段我们觉得做产品比较难 , 高年龄段做产品比较简单 ,但是那个内容会偏难 , 可能学的人比较少 , 可能大部分都得是从我们这升上来的人做 。

所以我们就先从这个中年的那开始 。

申远1:14:22

哦 , 然后然后再往两边这样拓展 , 对吧 ?

修佳明1:14:25

对对对 。

申远1:14:27

本期节目就到这里 , 谢谢修老师跟我们分享的主动式 AI Agent 产品在教育领域的一个率先的应用 。 本期节目由斑马口语特别支持播出 。

如果你对今天聊的话题有观察 、 好奇或疑问 , 欢迎在评论区分享你的想法 , 这也会成为我们节目的一部分 , 让整个讨论更完整 。

你也可以把我们的节目分享给对这个话题感兴趣的朋友 , 欢迎推荐更多你想听的主题和嘉宾 。

你可以从小宇宙 、 苹果 Podcast 等渠道关注晚点聊 LateTalk,也欢迎关注我们的公众号晚点 latepost, 下期再见