I Built an AI Japanese Tutor with Gemini Live in 6 Steps
PeterYangYT · 2026-10-05

用 Gemini 实时语音 API 加 Nano Banana 画图,作者花 3 小时做出能跟 AI 教练 Yuki 打电话练日语的 App,其中 2 小时全耗在改 bug 和改课程内容上。
一个能实时对话的日语陪练 App,听起来像要一个团队做几个月,作者却只用 3 小时就上线了。他反复强调:真正拉开差距的不是写代码,而是那 2 小时里对课程内容和交互细节的死磕。下面拆开这 6 步,看每一步具体在干什么。
先跟 AI 聊清楚要做什么,别急着动手
作者第一步不是写代码,而是让 AI 先做研究、再反问自己三个问题,把"用户问题"和"解决方案"先钉死。
- 提示词里写死了约束:去日本旅行、要 100 句真实用得上的短语、拆成 10 课每课 10 句、手机网页优先,还要求参考他之前做的 Tastemaker 的视觉风格。
- 明确要求 AI 先别动手:让它先调研 Gemini 有哪些可用模型(发现谷歌新出了实时语音模型),然后反问三个问题——实时通话该是什么体验、每句短语怎么排版、谁会用它。
- 作者的回答决定了产品形态:先教 10 句、再角色扮演来回练;每句同时显示日文、罗马音和英文;因为 API 要花钱,不打算商业化,先给自己和几个朋友用。
先出设计稿再写代码,改起来便宜
作者用自制的 spec skill 生成一份带手机和桌面两套界面图的规格文档,而不是一堆干巴巴的需求文字。
- 规格文档里直接画了关键页面:进度路径页、带对话气泡和通话按钮的课程页,还列了要调用的 API 和技术栈,看一眼就懂 App 长什么样。
- 用开源的 human review 工具像改 Google Doc 一样改规格:可以直接在页面上改文案、圈出某个框写"这课改成讲食物",再把反馈丢回给 AI 执行。
- 没有设计师也能干活:作者说自从让 spec skill 顺带生成两三张界面图,他就能对着图直接给反馈,比读需求文档快得多。
真正的功夫在迭代:修麦克风、换图、重排课程
第一版一次成型,但作者说 3 小时里有 2 小时都耗在这一步,这才是"能用的 App"和"垃圾 App"的分界线。
- 麦克风 bug 是 Claude Code 自己测出来的:App 默认收 MacBook 内置麦克风,作者用的是外接麦,AI 自己进 App 里听声音、定位问题并修好。
- 对话气泡和图片一起改:原来气泡一次性全冒出来,改成学一句显示一句,响应速度太慢也一并修掉;图片从"垃圾图"换成 Nano Banana 生成的微缩景观风,确认一张后让 AI 给 10 课全做一套,给 Yuki 生成头像时 AI 先画了个饭团,被要求改成女孩,因为 Yuki 是女声。
- 课程顺序被重排:原本最后一课是"生病、药店、紧急情况",作者觉得不该以负面内容收尾,要求打乱;还确认了一件事——不学认日文也能开口说日语,所以先不教读写。
带走一句话
"区分一个随手糊出来的 App 和一个真正有品质的 App 的,就是你愿意花多少心思去打磨课程和 App 本身。"
- 把 API key 粘进本地 .env 文件,不要直接贴在 AI 聊天框里——作者演示完立刻删掉了视频里露出的那个 key,这个习惯值得抄。
- 让 AI 先调研再反问你三个问题,比直接说"帮我做个 App"能省掉后面大量返工;这一步花 10 分钟,可能省下 1 小时。
