↩️🎬 豆包实时语音上线全新 SeedRealtime 音视频全双工大模型


科技圈🎗在花频道📮:

🤖 OpenAI 发布 GPT-Live 语音模型,支持全双工实时对话 OpenAI 发布新一代语音模型 GPT-Live,采用全双工架构实现边说边听的实时对话,即日起向全球 ChatGPT 用户推出。该模型可同步处理输入与输出,能在对话中自然回应、允许用户随时打断或停顿,并会在后台调用 GPT-5.5 完成搜索与深度推理等复杂任务。 GPT-Live 分为 GPT-Live-1 与 GPT-Live-1 mini 两个版本,将分别成为付费与免费用户的 ChatGPT Voice 默认模型。新版本还增…

豆包实时语音上线全新 SeedRealtime 音视频全双工大模型

字节跳动 8 月 5 日发布原生音视频全双工大模型 SeedRealtime。该模型以统一架构融合音频、视频与文本,支持在连续多模态信息流上实时交互,具备音视频联合理解、主动环境感知与流畅对话节奏三项核心能力。端到端人工评测显示,其音视频对话节奏问题较级联模型减少一半,"话未说完被抢断"等卡壳现象显著减少。目前该模型已在豆包 App 全量上线。

不同于传统级联系统依赖 ASR、VLM、TTS 多模块串联造成的延迟与信息损耗,SeedRealtime 将感知、理解、决策与表达纳入同一端到端模型同步进行,无需外置 VAD 判断轮次,可实现"边看、边听、边说"的全双工自然交互。

字节跳动 Seed

🌸 在花频道 · 茶馆水群 · 投稿通道
Video is too big


via 科技圈🎗在花频道📮 - Telegram Channel
 
 
Back to Top
Copyright © 2025 BESTAI. All rights reserved.
BEST AI API中转 - OpenAI DeepSeek Claude Gemini Grok MidJourney API 2.8折起
admin@oaibest.com