返回首页
Sesame

Sesame

语音生成与转换

Sesame 做的是端到端实时语音对话模型与同名语音助手,主打带情绪与语气的自然对话,已推出 iOS 与安卓应用,官网称未来将支持眼镜等可穿戴形态。

语音对话大模型移动应用
月访问量68.6 万↓24.9%
全球排名#71,958
月访问量为第三方平台估算,仅供参考
访问网站
访问官网 ↗

详细介绍

Sesame 官网首页只有一句定位:「Intelligence with a point of view.」,副标题写明 Sesame voice agents 是「everyday collaborators who help you do more, talk things through, and follow your curiosity」,页脚署名为 Sesame AI Inc.。从官网 Research 页面能看出技术侧重:这家公司研究的是「Crossing the uncanny valley of conversational voice」,目标是做出具备「voice presence」的对话伙伴。它不是把文字朗读出来,而是端到端的实时语音对话模型。目前官网标注可在 iOS 与 Android 下载,并写明即将进入眼镜形态。

核心能力

  • 端到端语音对话:研究重点是 conversational speech generation,官网强调不依赖级联的文本中间层,让语音交互更连贯。
  • voice presence 目标:官网列出四个关键构成——情绪智能、对话动态(自然的语速、停顿、打断与重音)、语境意识、一致的个性。
  • 语气与情感表达:官网明确指出今天的数字语音助手缺少关键品质,认为只会用中性语调说话的助手难以融入日常。
  • 多形态终端:首页标注 Available on iOS and Android,coming soon to eyewear。
  • 研究开放:官网设有 Research 与 Journal 板块,并开放 conversational speech 的 preview 试听。
  • 合规文件:页脚提供 Terms of conditions、Privacy Policy 与 Acceptable Use Policy。

适合谁

  • 想要一个能随时聊两句、随口拆解思路的移动端语音助手的用户。
  • 关注语音大模型技术路线的研究者与开发者,Research 页面有技术文章与试听入口。
  • 眼镜等可穿戴设备厂商与生态合作方,官网已公开预告眼镜形态计划。
  • 对现有助手「语调平、没有情绪」失望、想体验更自然语音交互的普通用户。

使用建议

  • 它更适合作为语音形态的助手而不是内容生产工具:想找 TTS 配音或播客剪辑工具的人应看别的类目。
  • 先在手机端试 App,官网目前写明 iOS 与 Android 可用,其他终端仍是即将状态,不要按已上线规划接入。
  • 语音助手会持续处理音频,涉及私人对话建议在安静环境使用,并留意官网 Acceptable Use Policy 的边界。
  • 官网研究页面也写了「We're not there yet」,仍在人格、记忆、表现力与恰当性上迭代,能力边界应按预览版看待。