火山引擎于2026年6月23日上线了“豆包音频生成模型1.0”(Seed-Audio 1.0)。该模型实现了从“语音合成”到“音频生成”的跨越,支持影视级全要素直出,能一次性同步生成人声、环境音和特效音。此外,它还具备长程延长一致性及参考音频生成能力,大幅降低了有声书、漫剧等音频内容的后期制作门槛。

AIWW评析

这一突破的本质是AI从“模仿人声”进化为“解构并重组空间场面”。它将过去依赖多轨剪辑的协同工作转化为单一 prompt 的逻辑输出,不仅重塑了声音导演的协作边界,更预示着个人内容生产的结构性爆发生态。

6月23日,火山引擎在Force原动力大会上发布字节跳动新一代通用大模型豆包大模型2.1。该模型在代码生成、智能体及视觉语言能力上实现突破,支持仓库级理解与自动化异常自纠,并推出长文本推理模式。...
百度开源了名为Unlimited OCR的文档解析模型,在32K上下文限制下实现了单次前向推理直接解析数十页长文本的能力。该模型基于DeepSeek OCR构建,创新性地采用参考滑动窗口注意力机制(R-SWA),将...
前往“AIWW”小程序,更好用