
Sesame
语音生成与转换Sesame 做的是端到端实时语音对话模型与同名语音助手,主打带情绪与语气的自然对话,已推出 iOS 与安卓应用,官网称未来将支持眼镜等可穿戴形态。
详细介绍
Sesame 官网首页只有一句定位:「Intelligence with a point of view.」,副标题写明 Sesame voice agents 是「everyday collaborators who help you do more, talk things through, and follow your curiosity」,页脚署名为 Sesame AI Inc.。从官网 Research 页面能看出技术侧重:这家公司研究的是「Crossing the uncanny valley of conversational voice」,目标是做出具备「voice presence」的对话伙伴。它不是把文字朗读出来,而是端到端的实时语音对话模型。目前官网标注可在 iOS 与 Android 下载,并写明即将进入眼镜形态。
核心能力
- 端到端语音对话:研究重点是 conversational speech generation,官网强调不依赖级联的文本中间层,让语音交互更连贯。
- voice presence 目标:官网列出四个关键构成——情绪智能、对话动态(自然的语速、停顿、打断与重音)、语境意识、一致的个性。
- 语气与情感表达:官网明确指出今天的数字语音助手缺少关键品质,认为只会用中性语调说话的助手难以融入日常。
- 多形态终端:首页标注 Available on iOS and Android,coming soon to eyewear。
- 研究开放:官网设有 Research 与 Journal 板块,并开放 conversational speech 的 preview 试听。
- 合规文件:页脚提供 Terms of conditions、Privacy Policy 与 Acceptable Use Policy。
适合谁
- 想要一个能随时聊两句、随口拆解思路的移动端语音助手的用户。
- 关注语音大模型技术路线的研究者与开发者,Research 页面有技术文章与试听入口。
- 眼镜等可穿戴设备厂商与生态合作方,官网已公开预告眼镜形态计划。
- 对现有助手「语调平、没有情绪」失望、想体验更自然语音交互的普通用户。
使用建议
- 它更适合作为语音形态的助手而不是内容生产工具:想找 TTS 配音或播客剪辑工具的人应看别的类目。
- 先在手机端试 App,官网目前写明 iOS 与 Android 可用,其他终端仍是即将状态,不要按已上线规划接入。
- 语音助手会持续处理音频,涉及私人对话建议在安静环境使用,并留意官网 Acceptable Use Policy 的边界。
- 官网研究页面也写了「We're not there yet」,仍在人格、记忆、表现力与恰当性上迭代,能力边界应按预览版看待。
相似工具

豆包语音
火山引擎的语音大模型产品线,覆盖语音合成、声音复刻、语音识别、实时语音与音频生成等能力,官方称提供 400+ 音色、30+ 语种,面向企业支持 API 与 SDK 接入。
同分类

DeepSeek 深度求索
DeepSeek 是深度求索的大模型系列,官方开源 V4、R1 等前沿模型,提供网页版、手机应用与开放 API,主打高性价比与原生多模态视觉理解能力。
同标签 · 大模型

Typecast
表现力见长的 AI 语音生成器,官网称提供 700+ AI 音色,可调节情绪、语速与力度,部分音色来自真实配音演员授权,面向创作者、开发者与企业。
同分类

Speechify
主打把任何文本读给你听的 TTS 助手,官网称覆盖网页、Chrome 插件与 iOS/Android/Mac/Windows,提供语音输入、配音与声音克隆等能力。
同分类

PolyAI
PolyAI 提供企业级语音 AI 代理平台,对话自然逼真,能在欺诈、故障、分诊等复杂场景实时构建、运行并合规治理,覆盖医疗、酒店、零售等行业。
同分类

讯飞星火
讯飞星火是科大讯飞推出的认知智能大模型,覆盖百科问答、内容写作、图像生成、PPT、代码、录音纪要、精准翻译与拍照解题,并提供星火 API 供开发者接入。
同标签 · 大模型
