← 全部日报

AIGC 信息日报

2026 年 9 月 12 日 周六

行业与平台

Industry

ElevenLabs 用 Music v2.5 把灵感变成完整歌曲

ElevenLabs 发布 Music v2.5 音乐生成模型,输入一段想法、音效或 loop 即可生成完整歌曲,支持长篇幅作曲、曲中风格切换、说唱、歌词以及母语级人声演唱。对短剧配乐、原创 BGM 和带唱段内容的后期团队来说,这是把音乐生成从片段拼接推进到整曲产出的更新。

从一段动机、音效或 loop 直接生成完整歌曲,支持长曲式、中途换曲风、说唱和人声,做短剧配乐和原创 BGM 的可以拿它跑一版试试。

点击打开原平台查看,能否访问取决于网络环境

Runway 开放模型权重授权,企业可自训自托管

Runway 官方宣布企业可授权使用其前沿模型权重,支持用自有数据微调、部署在自家基础设施上,并对产出内容商业化,同时提供白手套服务和 Forward Deployed Researchers 驻场支持。对想摆脱通用 API、把生成能力沉淀成自有资产的影视公司和短剧团队,这是一条自建模型能力的路径。

Runway 把自家前沿模型权重拿出来做企业授权,可拿自有数据微调、自托管、商业化,还配 Forward Deployed Researchers 驻场。做 AI 影视的公司和想自建生成能力的团队可以看看这条路。

点击打开原文,能否访问取决于网络环境

工信部印发人工智能+软件专项行动方案

工信部印发《人工智能+软件》专项行动实施方案:到 2028 年培育高水平智能编程工具和智能开发平台,推广覆盖 2 万家规模以上软件企业,组织实施 100 项智能化技改项目,打造 100 个智能体软件标杆应用,孵化 5 个以上优质开源项目;到 2030 年关键软件全面实现智能化升级。政策指向的是软件与智能体产业,与影视创作流程没有直接关系。

到 2028 年要覆盖 2 万家规上软件企业、打造 100 个智能体软件标杆应用,做 AI 工具链和智能体产品的团队可以对着这份指标看自己能不能进盘子。

YuE2 音乐生成模型发布,SongBench 得分超 Suno v5

YuE2 项目页发布音乐生成模型 YuE2,以可编辑符号乐谱(ABC 记谱)为中间表示生成全曲音频,支持旋律、节奏、和弦的可视化与编辑,示例含 Industrial Hip Hop、Chamber Folk 等风格,可做旋律重映射(如 F 大调转 D 小调)。在 WildSongBench(192 prompts)的 SongBench 上,YuE2 best-of-8 得 6.9632,为 15 个设置中最高观测均值,Suno v5 同对比得 6.8721。

YuE2 用可编辑符号乐谱做中间层生成整曲,SongBench 6.9632 略高于 Suno v5 的 6.8721,做 AI 配乐和短剧 BGM 的可以拿它跑几首对比听感。

小米开源目标说话人语音识别模型 CocktailASR-1

小米发布并开源工业级目标说话人语音识别大模型 Xiaomi-CocktailASR-1,针对多人同时说话时识别率骤降的「鸡尾酒会」难题。模型采用全流程 LLM 架构,以目标说话人的一段参考音频作为声纹提示,在多人环境中只提取并转录目标用户语音,多个主流多说话人测试集上达到 SOTA;单人识别性能比肩标准 ASR,可拒识非目标说话人(目标不在场时输出空文本),并支持思维链推理模式给出可解释过程。代码已开源于 GitHub 与 HuggingFace。

多人同场时只转写指定说话人,目标不在场直接输出空文本,做访谈、群戏同期声和播客后期的可以拉下来跑一遍,看能不能省掉人工挑轨。

点击打开原文

fal 发布 H3 Max 相机控制 3D 视频模型

fal 发布 H3 Max Camera Controls,号称全球最快的 3D 视频模型,能把单一视角画面在 3 秒内转成可导航的 3D 场景,并支持以度数设定水平与垂直相机角度,让镜头在场景中移动同时保持画面一致。适合做分镜预演、虚拟运镜和场景探索的创作者测试。

单张视角图 3 秒内变成可自由运镜的 3D 场景,还能按度数精确设定水平垂直机位角度,做分镜预演和虚拟拍摄的可以上手试运镜。

点击打开原平台查看,能否访问取决于网络环境

Higgsfield 推出 After Effects 版 ChatGPT 插件

Higgsfield AI 发布 ChatGPT 插件「Motion Designer」,可在 After Effects 中做动态设计:插件理解动画原理、能编写表达式,并在 AE 项目里保留上下文。官方称现在即可在 After Effects 中试用该插件。对做动效、包装和批量套版的后期来说,这类把 AI 直接嵌进 AE 工作流的工具,主要价值在减少手写表达式和重复调整的环节。

做后期的可以留意:这个插件能在 AE 里写表达式、理解动画原理并保留项目上下文,动效和批量套版环节能省不少手写代码的时间,装一个跑两周看顺不顺手。

点击打开原平台查看,能否访问取决于网络环境

ComicForge 上线:文字故事一键转整本漫画

ComicForge 推出一款 Web 应用,把文字故事转成完整漫画书:自动绘制每一页、设计封面,支持 29 种语言撰写全书。用户可从八种艺术风格中选择(欧洲漫画到日式漫画),上传照片可让人物面孔在整本书中保持一致,成品为 2 到 40 页,可导出 PDF 或 CBZ 文件。

八种画风可选、照片锁人物脸、2 到 40 页导出 PDF/CBZ,做漫画和分镜预演的可以拿自己的剧本跑一本试试。

点击打开原平台查看,能否访问取决于网络环境

Sakana AI 发布 Fugu Max 与 Fugu Ultra v2 调度模型

Sakana AI 发布 Fugu 系列两款新模型 Fugu Max 与 Fugu Ultra v2,二者共用同一套调度架构,通过单一 OpenAI 兼容 API 在多个模型间路由任务:Fugu Max 追求每美元最佳产出,Fugu Ultra v2 面向高难度多步任务。两款模型今日已上线托管 API,无开放权重,且不在 EU/EEA 提供服务。Fugu 于 4 月进入 beta、6 月正式可用,7 月新增 Fugu-Cyber 与 Claude Code 接口。

Sakana 把「多模型路由」做成一个 OpenAI 兼容 API,Fugu Max 主打每美元产出、Ultra v2 主打多步硬任务,做批量生成调度的技术整合者可以接 API 测一周成本曲线。

点击打开原文,能否访问取决于网络环境

大学生用商汤 Seko 做 AI 恐怖日剧《渡骸》

抖音作者 CHunye 的 AI 恐怖日剧《渡骸》,设定为日本打捞船从海底捞起一口中国古棺、唤醒僵尸,因画质逼真被部分观众误认为 Netflix 出品。据该推文称制作使用商汤 Seko AI 视频创作平台,具体为其中的 Seko 画布(无限画布)。做 AI 短剧的可以找原片看恐怖题材的画质与氛围处理。

抖音作者 CHunye 的 AI 恐怖日剧,画质逼真到被误认成 Netflix 出品,据说用商汤 Seko 画布做的。做 AI 短剧的可以找原片看画质和恐怖氛围怎么处理。

点击打开原文,能否访问取决于网络环境

工具与能力

Tools

MiniMax Design 升级:GPT-6 Astra 上线并新增 MCP 集成

MiniMax Design 大版本升级:接入 GPT-6 Astra,新增 Blender、PS、AE 等 MCP 集成,支持协作项目;可用一句提示词生成 3D 模型,并把 AI 片段直接转成可编辑的 AE 工程。对后期和视觉创作者来说,AI 素材进 AE 后能继续改图层和参数,比只能导出成片的工具更贴现有剪辑流程。

AI 片段能直接转成可编辑的 AE 工程,后期这条最实用;做 3D 和视觉的可以试一句提示词出模型,顺手把 Blender/PS 接进流程。

点击打开原平台查看,能否访问取决于网络环境

Suno 支持从图片视频和哼唱生成歌曲

Suno 官方演示三种新输入方式:上传照片可生成对应主题的歌曲(如「根据这张照片做一首乡村歌」),上传视频可为其生成配乐,哼唱 15 秒可让模型以这段哼唱为主干扩展成完整歌曲。对短剧和预告片后期来说,视频直接出配乐这条能省掉找版权音乐和手动对点的环节。

上传一张照片或一段视频就能出配乐,哼 15 秒还能当骨架扩成整首歌,做短剧配乐和预告片声音的可以拿手上的素材试一轮。

Runway Astra 接入 ChatGPT 内直接创作

Runway 官方宣布 Astra 可在 ChatGPT 内直接调用创作。同一条推文还演示了一条混合工作流:先用 Runway 出风格帧,再进 Blender 做动画,最后用 Seedance 2.5 完成渲染,从单张产品图走到成片动画。对做视觉开发和分镜预演的创作者来说,多了一个在对话窗口里直接起稿的入口,具体调用方式和额度限制需看链接原文。

Runway 把 Astra 塞进 ChatGPT,聊天窗口里就能起稿出图,做视觉开发和分镜预演的可以试一下这条流程顺不顺手。

点击打开原平台查看,能否访问取决于网络环境

Astra 可描述图形与场景物体的交互方式

Magnific 的 Astra 新增能力:用户可用自然语言描述图形与场景中物体的交互方式,包括每个变换的触发条件以及最终呈现效果。官方示例中,橙子和网格在纸上印出纹理,纸张随后折叠成袋子包住水果。适合需要精确控制图形与实物互动关系的视觉开发、广告 KV 和产品概念图场景。

做视觉开发和 KV 的可以试:用一句话描述触发条件和最终画面,Astra 就按这个逻辑生成图形与实物的交互效果,比如橙子和网格在纸上印出纹理再折成袋子包住水果。

点击打开原平台查看,能否访问取决于网络环境

Recraft Studio 接入 Gemini Omni Flash 1.1

Recraft 官方宣布 Gemini Omni Flash 1.1 已接入 Recraft Studio,主打多参考图合成生成新视频素材,最多可同时组合五张参考图。适合需要把多个视觉元素(角色、场景、风格)拼进同一段视频的创作场景。做视觉开发和分镜预演的可以实测多参考合成时的角色一致性和画面稳定性。

Recraft 里现在能直接调 Gemini Omni Flash 1.1 出视频,最多拼五张参考图,做视觉开发和分镜预演的可以拿它试多参考合成的稳定性。

点击打开原平台查看,能否访问取决于网络环境

Sources up to 15 seconds, normalized to 24fps, anything…

OpenRouter 上线视频编辑接口:源片最长 15 秒,统一转 24fps,超过 720p 自动降采样;时长、分辨率、画幅和音频都跟随源片而非参数设定,多条编辑指令可叠加在同一个 prompt 里,10 秒片段收费 0.30 美元。做批量剪辑、自动化后期和短剧流水线的团队可以按这个价格算一下成本。

按秒计费的视频编辑 API,10 秒 0.3 美元,源片时长/分辨率/画幅/音轨自动继承,多条编辑指令能塞进一个 prompt。做批量剪辑和自动化后期的可以接上跑一周,算算比自己搭省多少。

Synthesia 上线自定义数字人,文字提示即可生成

Synthesia 官方宣布上线自定义数字人功能,用户可通过文字提示或微调面板控制,生成真人主播、品牌吉祥物、风格化角色三类形象,替代原有固定素材库。适用于口播视频、虚拟主播、品牌形象类内容制作。

Synthesia 把数字人从固定素材库改成可自建,文字提示或面板微调就能出真人主播、品牌吉祥物、风格化角色,做口播和虚拟主播的可以上手试一批。

点击打开原文,能否访问取决于网络环境

HeyGen 分享素材块目录并征集改进建议

HeyGen 的 Jake Moran 发推邀请大家试用 Hyperframes 素材块目录(hyperframes.heygen.com/catalog/blocks),并公开征集「还希望目录里加什么」的反馈。推文本身只给了目录链接和一个 carousel-circle-1 素材块示例,没有说明具体新增了哪些块、参数或价格。做数字人视频、批量出片的团队可以进目录翻一遍,看现有素材块能否直接接进自己的出片流程。

HeyGen 的 Hyperframes 素材块目录开放试用,发帖人还在征集补充需求,做数字人视频和批量出片的可以点开翻一遍看有没有能直接套的模块。

点击打开原平台查看,能否访问取决于网络环境

Alexandr Wang 称 Muse 可为任意主题生成播客

Alexandr Wang(@alexandr_wang)发推称 Muse 能为用户制作任意主题的播客,原文仅一句「muse can make you a podcast on anything you'd like」,未附演示、参数或使用入口。对做音频内容、播客和配音的创作者来说,这条目前只提供了一个产品名和一句能力描述,实际音质、时长、语言支持和生成流程都无从判断。

一句话带过的产品宣传,没给参数、没给入口、没给样例,做播客和音频内容的可以先记下这个名字,等有实测再判断。

点击打开原文,能否访问取决于网络环境

方法与经验

Methods

GPT-6 Astra 经 MCP 操作达芬奇半小时剪出 4K 旅行片

郭宇(@turingou)用 GPT-6 Astra 通过 MCP 操作达芬奇,把 2020 年四季岛旅行拍下的 479 段、约 90GB 素材剪成近 20 分钟的 4K 旅行电影,从整理素材到成片导出约半小时。原文未展开具体剪辑决策细节。对后期和剪辑团队来说,这是 AI 直接驱动专业剪辑软件跑完整流程的实操样本,值得照着试自己的素材库。

479 段 90GB 素材到 20 分钟 4K 成片只用半小时,靠 MCP 直接驱动达芬奇。后期和剪辑团队可以照着这个思路试自己的素材库。

点击打开原平台查看,能否访问取决于网络环境

GPT 6 Astra+Blender 白模接 Seedance 2.5 出电影级运镜教程

作者 @Magncsans 发布 10 分钟教程,讲用 GPT 6 Astra 配合 Blender 建白模,再结合 Seedance 2.5 生成电影级运镜和画面。内容覆盖白模要建到什么标准、如何结合白模写提示词、过程中的常见坑,以及 Blender 之外的其他白模玩法,视频中展示的白模和提示词全部公开分享。

10 分钟讲透白模该建到什么精度、怎么照着白模写提示词、哪些坑要绕,白模和提示词全部公开。做 AI 短片和分镜的可以照着跑一遍,运镜控制这块能省不少试错。

点击打开原平台查看,能否访问取决于网络环境

Dreamina 邀 Peter 实测其工作流管道

Dreamina AI 邀请 Pwnisher Challenge 冠军、Dreamina 3D Reference 创意赛评审 @manuelpeterCGI 实测一条工作流:GPT-6 Astra 生成航天飞机 3D 模型,配合参考图生成发射台并放进 Blender 场景;在 Blender 里定机位和镜头运动,做一次 Viewport Render;再把这段渲染当参考视频喂给 Dreamina,配合参考图和详细提示词生成发射画面。作者称机位、节奏、画面观感全程可控,后续补拍其他机位也容易。

3D 建模、Blender 定机位、Seedance 2.5 出成片,三段串成一条流程,做科幻镜头和预演的可以照着跑一遍。

点击打开原平台查看,能否访问取决于网络环境

Topaz Astra 2 放大模型助 AI 影片上球幕

Topaz Labs 官方分享日本导演 Aurora Aura 的案例:她指出 AI 生成视频在大画幅下的精细细节是弱项,用 Topaz Labs 的 Astra 2 放大模型处理后,影片达到球幕放映标准。据其描述,Astra 2 不只是减少模糊和噪点,还能补充细节。做 AI 影像后期、需要把成片放大到影院/球幕等大屏的团队可参考这条放大工作流。

AI 视频放大到球幕这种大画幅,细节和噪点是老大难。日本导演 Aurora Aura 用 Topaz Astra 2 把片子做到能上球幕放映,做后期和视觉的可以看看它怎么处理大尺寸下的细节。

点击打开原平台查看,能否访问取决于网络环境

GPT-6 Astra 可生成可动画高斯泼溅角色

Viggle AI 称 GPT-6 Astra 现已能生成可动画的高斯泼溅角色,并将其接入 PINOC MCP。仅凭描述角色与动作,就做出了一款 backrooms 风格、类似 Exit 8 的游戏。Astra 通过 PINOC 的免费预设动画和文本生成动画产出角色及全部动作,并自行编写循环与异常逻辑,几轮会话内完成整个项目。

高斯泼溅角色能直接带动画,还接进 PINOC MCP 自动写循环和异常逻辑,做 3D 角色和互动内容的可以看看这套流程怎么串的。

点击打开原文,能否访问取决于网络环境

VOIDZ 用 Seedance 2.0 制作 95 秒纪实片《Ends Meat》

艺术家 VOIDZ 在 Runway 访谈中介绍其约 95 秒纪实混合现实影片《Ends Meat》的制作过程,全片含 15 处超现实干预。他用 Seedance 2.0 扩展和修改真实拍摄的购物素材,让商品在画面中膨胀变形,隐喻生活成本压力。他表示过去这类片子受传统 3D 流程限制只能做 10-15 秒,完全用传统 VFX 可能需六个月到一年。

传统 VFX 要半年到一年的活,这次靠 Seedance 2.0 改实拍素材做出来了。做混合现实和超现实视觉的可以拉片看那 15 处干预怎么落地。

Glif Agent 自动卡点剪辑:Omni 1.1 配 Seedance 2.5

Glif 官方演示:用 Google Omni 1.1 加 Seedance 2.5 生成素材,再由 Glif agent 完成音乐卡点对齐和自动剪辑,全程不手动操作剪辑软件,创作者只负责给 agent 下导演指令。推文附了创建链接。对后期和剪辑岗来说,这是一条把「生成素材」和「按节奏剪好」串成一步的自动化流程参考。

Glif 的 agent 把卡点对齐和自动剪辑全包了,人只负责下指令,不用手动在剪辑软件里对拍子。做 MV、混剪、短剧片头的后期可以点进去跑一遍,看它卡点准不准。

点击打开原平台查看,能否访问取决于网络环境

团队用老照片加姿态模型复原未拍摄的记忆

Google DeepMind 团队为纪录片《Love, Rendered》复原了一段从未被拍摄过的记忆:把修复后的档案照片与姿态控制模型配对,还原 Burt 和 Ethelle 两人的举止习惯与微表情,重现他们初次相遇那天的场景。这是把静态老照片转成有表演细节的动态影像的一次具体实践,涉及照片修复、姿态驱动和表情还原几个环节。做历史纪录片、老照片活化、档案影像复原的后期和视觉团队可以看这套流程怎么串。

纪录片《Love, Rendered》里,团队把修复后的档案照片配上姿态控制模型,还原 Burt 和 Ethelle 初遇那天的神态和微表情。做历史题材、老照片活化、纪录片复原段落的后期和视觉可以拉片看这套做法。

点击打开原平台查看,能否访问取决于网络环境

实测 GPT Images 2.5 多轮生成五次后人物特征丢失

X 用户 ZHO(@ZHO_ZHO_ZHO)实测 GPT Images 2.5 的人物特征保持能力:连续生成约 5 次后开始丢失人物特征,多人物场景尤为明显,噪点问题也随之加重,作者以第二次与第五次生成结果对比展示退化过程。做角色一致性和多人物分镜的视觉师、短剧团队可据此判断多轮迭代的安全轮次。

做角色一致性的视觉师和短剧团队可以看这份实测:连续生成约 5 次后人物特征开始丢,多人物场景和噪点问题更明显,作者用第二次和第五次结果做了对比。

点击打开原文,能否访问取决于网络环境

Suno V6 与 Lyria 3.5 音乐生成实测对比

音乐创作者 Alex Patrascu 用 10 组新提示词、相同剪辑片段对比 Suno V6 与 Lyria 3.5。他认为 Suno V6 相对前代是退步,仍有金属音色,写歌和抓耳副歌能力强,但对子流派理解变差、风格糊成单一氛围,多样性不如旧模型,每条提示词听感雷同。Lyria 3.5 进步明显,乐器分离度和频谱空间感好,成曲更像真实歌曲,但命中率约一半,需要多次重试。ElevenMusic V2 因额度用尽未参与本轮测试。

同一批剪辑片段、10 组新提示词横评 Suno V6 和 Lyria 3.5,作者直言 V6 是退步、金属味重、子流派糊成一团,Lyria 乐器分离度好但命中率只有一半。做配乐和短剧声音的可以拿这份听感清单当选型参考。

点击打开原平台查看,能否访问取决于网络环境

作品与案例

Works

伦敦导演贾泽·李用 Seedance 2.5 做 AI 短片《Candy》

电影节评委 @Uncanny_Harry 推荐伦敦导演贾泽·李的新作《Candy》。贾泽·李出身数字艺术家和动画师,现为伦敦工作导演,已转向 AI 工具创作。该片用 Seedance 2.5 同时承担特效与叙事功能,皮肤质感、指甲、蚂蚁等细节处理是亮点。发帖人认为 Seedance 2.5 正让越来越多传统电影人和动画师开始尝试 AI 电影制作。

伦敦工作导演贾泽·李的新片《Candy》,用 Seedance 2.5 同时当特效和叙事工具,皮肤质感、指甲、蚂蚁这些细节是看点,做 AI 短片的可以拉片看细节处理。

点击打开原平台查看,能否访问取决于网络环境

微信公众号 光影漫游AI 二维码
觉得日报有用的话,欢迎关注微信公众号,AI 影视创作的内容都在那里。
光影漫游AI
微信内长按二维码识别,或复制名称到微信搜索