发布日期:2026-07-15 21:51 点击次数:194
科技日报讯(记者杨雪)视频生成模型正在成为产业智能化升级的又一项关键基础设施。6月23日,火山引擎在2026夏季FORCE原动力大会上集中发布豆包大模型2.1,以及视频、图像、音频等多款新模型。
最新的豆包视频生成模型Seedance 2.5在大会上首次亮相,预计将于7月正式上线。据介绍,Seedance 2.5实现了30秒单段原生视频直出、最多支持50个全模态素材联合生成、保持画面一致性的局部编辑等多项能力提升。
值得注意的是,Seedance所代表的技术路径,不只是“做视频”——它是走向理解物理世界的“世界模型”的实现路径之一。火山引擎总裁谭待表示,Seedance在实体产业中有巨大的应用潜力。目前,Seedance已在具身智能、工业制造、智能驾驶等领域落地,为数据合成、场景仿真、流程演示等业务需求提供新的工具能力。
视频生成模型通过对连续视觉画面的学习和生成,形成对场景变化、空间关系和运动规律的建模能力。相较于只处理静态图像或文本的模型,视频生成模型天然面对时间、空间、动作和环境变化,因此在内容生产之外,也具备服务产业仿真、训练数据生成和复杂场景推演的潜力。
视频生成需要视觉理解,好的视频生成模型,离不开强大的基础模型支撑。视频数据打标、奖励模型(reward model)、提示工程(PE)、视频二次编辑,每一个环节都依赖底层语言与视觉理解能力。视频生成与视觉理解相互促进,使Seedance不只是“会画”,也开始具备更强的场景理解和连续推演能力。因此,它能够走出内容创作、进入更多实体产业场景。
例如,在具身智能领域,Seedance为机器人提供“看得懂、动得对”的视觉与物理常识底座,基于真实物理规律的场景仿真能力,让人形机器人在虚拟环境完成大规模训练后再迁移到现实。具体到Seedance 2.5此番能力升级来看:全球最长视频生成时长30秒,足以覆盖完整的机器人动作序列;全球最多参考数量的全模态多素材联合输入,可同时输入任务指令、环境照片、参考动作视频;可控的视频生成与二次编辑,可快速产出多条策略候选。这是人形机器人与具身智能产业从“硬件先行”走向“软硬协同”的关键一环。
据大会披露,目前,已有超过110万企业和个人使用火山方舟大模型服务,年Token(词元)调用量超过1万亿的企业已达200家,半年内增长一倍,覆盖互联网、制造、金融、汽车等多个行业。