边看、边听、边说

先想一个问题:你最后一次「指着什么东西」跟 AI 相处,是什么时候?

用地图 APP 问路、麻烦语音助手定闹钟……大多数时候,你跟 AI 的互动都长一个样:你说一句,它答一句。像隔着一道玻璃递纸条——你说完它才动笔,它说完你才开口。

但你跟朋友聊天不是这样。你会一边说话一边指着桌上的菜单,会说到一半停下来看对方的脸色,会在对方偏过头看窗外时,猜出他现在不想聊这个。

人跟人之间的交流,从来不是"轮到你就说"的四字口令。今天的 SeedRealtime,想把这些"看不见的时机"交给 AI。

一、接力赛与直连,差在哪儿

先看它改变了什么。

传统音视频交互是"级联"思路:ASR 把声音转成文字,VLM 看懂画面,TTS 再把回复变成声音。一个环节干一段活,就像接力赛——每次交接都要排队,每次交接都在丢信息。换个说法,这是一条"说话—打字—思考—听写—说话"的流水线,每拐一道弯,就慢一截。

更隐蔽的是轮次问题。不少方案靠外置的 VAD(语音活动检测)判断"该轮到谁开口了",本质上还是半双工:你讲完它讲,它讲完你再讲。可真实的人聊天,本来就会重叠、打断、抢话、附和。

SeedRealtime 的思路是直接推翻这套:把音频、视频、时序、表达,塞进同一个端到端模型里。不是听完、看完、再作答,而是在连续的音视频流上,同步做感知、理解、决策、表达。

翻译成大白话:它一边看你手机的镜头,一边听你讲,同时在心里琢磨——"这几个字,是在问我眼前的哪样东西?"

二、第一个突破:看得懂画面,分得清声音

音视频联合理解,是 SeedRealtime 最有杀伤力的一层。

挑个最有画面感的例子:川菜馆里,两个外国游客盯着全中文的菜单发愣。他们举起手机对着餐桌,问 AI"这道菜是什么"——单靠声音,模型只收到一串模糊的字符;但它同时在看画面,认出了桌上的菜。

于是它用英语推荐、解释菜品,还能顺着文化背景讲清楚"为什么鱼香肉丝里没有鱼"——"鱼香"不是食材里有鱼,而是说这道菜用鱼香风味的酱料调味。连"皮蛋是怎么做的"这种问题它也接得住。

还有更日常的一幕:四个人吃饭,人声嘈杂。你逐个介绍同伴——浅色头发的圆圆、戴眼镜的 Julia。SeedRealtime 记住每张脸对应的名字,接下来的对话全程能分清"这句话是谁说的",最后还给出一份让每个人都满意的旅行方案:想拍照的去海边、怕热怕累的待在室内、对海鲜过敏的绕开水产。

声音、画面、时序在同一个模型里对齐。"听到的"和"看到的",一起参与每一次判断。

三、第二个突破:它自己决定开口

人类交流里最微妙的,是"什么时候说话"。SeedRealtime 把这部分也交给了模型自己。

在河北博物馆,你说"看到错金铜虎噬鹿屏座就提醒我"。模型一直盯着移动的镜头,扫过那件展品时,主动出声提醒。这之后它还能接着讲解错金银的四龙四凤铜方案座、长信宫灯,讲铸造、错金银、焊接这些工艺。

这还不算最有意思的。真正让人眼前一亮的是,它干了还不等你开口的活:

比如你在家里操作一台复杂的咖啡机。镜头里你把整粒咖啡豆直接倒进萃取手柄,模型立刻纠正:"豆子不能直接倒,要先磨成细粉。"萃取完,它看一眼杯里油脂的厚度和液量,又主动补一句:"下次萃取时间缩短 2 到 3 秒。"

全程没有一个问题。这就是"持续视觉感知 + 主动介入":模型不是等你开口,而是自己判断场景里值不值得说话。

它还能一边盯,一边叫停

读论文也是这样。研读 ResNet 时,SeedRealtime 对着网络结构图,把跳接如何缓解梯度消失讲得清清楚楚。你再说一句"翻到训练参数那部分提醒我",它在快速翻页里一直盯着画面,一认出"3.4 Implementation"那个段落就主动叫停,随即报出学习率、动量、权重衰减这些关键参数。

四、最难的一环:知道什么时候不该开口

聊到这儿,你可能觉得"会主动开口"最先进。但我反倒觉得,SeedRealtime 最难的,是学会闭嘴。

语音天生带停顿,模型能借停顿判断你还会不会继续;但视频是永远在线的——画面里可能有人走动、有车流、有别人在说话。模型既要持续看懂发生了什么,又要分清"哪句话该我接,哪句话是背景音"。

这两个能力,在真实环境里被拆得很明白。

在大兴机场:同伴闲聊时随口一句"老李的航班",模型没有被这句无关的话带偏;可等你们真正发问时,哪怕航班大屏已经移出画面,它仍能结合先前看到的信息,报出实时到达时间,还联网查到行李转盘的位置。

最治愈的是陪孩子的场景。妈妈让 SeedRealtime 陪女儿学动物英文,背景里爸爸正在接电话,人声不停。它始终跟孩子手指的方向走,实时纠正发音、不停帮她造例句,没被那段无关的对话带偏一次。

该回应时不犹豫,不该理会时不偏航。这两句话写进产品介绍很容易,当成一个真实运行的模型来打磨,是真功夫。

五、数据也开口了

围观完,再给两组干巴巴的数字。

官方端到端人工评测里,相比级联方案,SeedRealtime 的音视频对话节奏问题减少了一半——"话没说完被抢断、话音已落却迟迟没回应、被环境杂音误触发"这类卡壳明显少了,单次对话能顺畅走完的概率也稳了不少。

还有一个"已经上线"的信息:SeedRealtime 已在豆包 App 全量上线,在对话框里选「打电话」,就能进入视频通话体验。也就是说,这套"边看边听边说"不是放在 PPT 里的 demo,而是真的能打开体验到的成果。

六、最后一层:从「能对话」到「能行动」

SeedRealtime 的真正价值,我觉得不在那些炫技的样子,而在它撕开了一个新的方向:AI 交互不再以"我问你答"作为默认前提。

接下来,它自己给出了四个方向:更流畅的节奏、更主动的感知与参与、更稳的多人嘈杂场景,以及最关键的顺势一步——打通工具与现实世界,让模型不仅能看能说话,更能替你查航班、订座位、办手续,把"听得懂、看得见"变成"帮得上忙"。

最后一件事:AI 最厉害的本事,是"知道不用说话"

所以,如果说过去十几年我们对 AI 的想象是一个"等我问完问题再认真回答的助手",SeedRealtime 悄悄换了脚本:AI 不必每次等你开口,就能读懂你在哪、在看什么、想要什么。

而我觉得最反直觉的一点是:我们总强调 AI 要"听懂",但它这轮进步最大的地方,恰恰是它读懂了"这个时刻不需要回应"

就像真正默契的朋友,不会在你思考时突然插嘴;也会在你一个眼神看过去时,主动补一句"这家店我吃过,别点微辣"。

所以,等你在豆包 App 里点开「打电话」,不妨也来一次这样的体验:把镜头慢慢转向你面前那碗鱼香肉丝,随口问一句"为什么这里面没有鱼"。

留意那个瞬间——AI 一边看着你的生活,一边陪你聊天,甚至不用你解释这碗菜是什么。

AI 不在等你说完,而是已经进入了你的世界。