查看: 8|回复: 0

Tavus 发布 Sparrow-2,让语音 Agent 学会等待和识别环境声

[复制链接]
  • TA的每日心情
    擦汗
    11 小时前
  • 签到天数: 2 天

    [LV.1]初来乍到

    1546

    主题

    54

    回帖

    4385

    积分

    管理员

    贡献
    1
    威望
    0
    金币
    2784
    社区币
    32
    发表于 昨天 09:00 | 显示全部楼层 |阅读模式

    Tavus 发布 Sparrow-2,让语音 Agent 学会等待和识别环境声

    Tavus 发布 Sparrow-2,让语音 Agent 学会等待和识别环境声


    AI 视频公司 Tavus 发布实时对话理解模型 Sparrow-2,并已在 Tavus PAL、API 和企业平台中正式可用。它不再只用静音时长判断用户是否说完,而是同时分析语义、词汇结构、语调、停顿、说话人和环境声音,持续判断系统应当倾听、等待、说话还是继续说。

    Sparrow-2 以 10ms 帧率流式处理音频,每秒可更新 100 次对话状态,粒度较上一代提高 4 倍;处理 80ms 音频约需 7ms,上一代约为 30ms。模型可区分「嗯」等附和与真正打断,在用户思考时等待 6~8 秒,并在声音无法可靠辨认时请求重复,而非基于错误转写继续回答。

    Tavus 称,模型使用 1.6 万段真实对话和 2000 段合成对话训练。在 575 个真实对话事件测试中,Sparrow-2 的时机判断失败率为 2.1%,约为最佳对比模型的四分之一;面对超过 1 秒的思考停顿,它有 97% 的情况不会抢话。上述对比包含 Tavus 自建评测,LiveKit 仅采用可在设备端运行的 v1-mini,并非其最先进模型。

    文章来源:https://www.ifanr.com


    您需要登录后才可以回帖 登录 | 立即注册

    本版积分规则

    手机版|小黑屋|网站地图|文强阁

    相关侵权、举报、投诉及建议等,请发 E-mail:admin@discuz.vip

    Powered by Discuz! X5.0 © 2001-2026 Discuz! Team.

    在本版发帖
    返回顶部