← 全部日报

AIGC 信息日报

2026 年 9 月 17 日 周四

行业与平台

Industry

阿里云 Wan3.0 开放 API 接入

阿里云 Wan3.0 视频生成模型开放 API 接入,可通过 Model Studio 和 Qwen Cloud 使用(该产品 8 月 26 日已发布)。官方称这不是增量更新,而是从 Wan 2.1、2.2 到 3.0 的跨代跃升,在运动参考、一致性、创意控制和分辨率上均有提升,官方表述是让模型对创作者、电影人和叙事者更友好。

阿里云把视频模型从 2.1/2.2 直接推到 3.0,官方点名运动参考、一致性、创意控制和分辨率四项升级,现已开放 API。做 AI 短片和短剧的可以接 Model Studio 跑一周,重点看角色一致性和运动参考稳不稳。

点击打开原平台查看,能否访问取决于网络环境

Runway 秋季模型合集上线

Runway 上线 Fall 2026 模型合集,官方称是其规模最大的一次模型更新,新增 Fish Audio S2.1 Pro、MiniMax H3 Max、Cartesia Sonic 3.6、Flux Video 放大与编辑,与 Runway 自有模型及其他前沿实验室模型并列可用。音频、视频生成、放大、编辑集中在同一平台内调用。

Runway 一口气把 Fish Audio S2.1 Pro、MiniMax H3 Max、Cartesia Sonic 3.6 和 Flux 视频放大/编辑塞进同一个平台,做后期和短剧的可以上去跑一遍,看配音、放大、剪辑能不能省掉来回切工具。

点击打开原平台查看,能否访问取决于网络环境

Gemini 3.8 Live 语音模型更新介绍

Google 在 Gemini API 和 Google AI Studio 更新 Gemini 3.8 Live 与 3.8 Live Extended Thinking 语音模型(该产品 9 月 16 日已发布),支持异步函数调用(后台执行 API/工具调用同时继续流式输出音频)、视觉上下文(对话可基于实时画面输入)、97+ 语言和可配置思考,Extended Thinking 版位列 Artificial Analysis 语音到语音榜单第一。同批还有 Gemini 3.5 Transcribe 语音转文字模型,覆盖 85+ 语言,流式平均词错率 4.0%、非流式 2.6%。

Gemini 3.8 Live 支持异步函数调用和视觉上下文,对话不中断就能后台跑任务,做 AI 配音、虚拟角色对话、实时字幕的可以接 API 试一周。

点击打开原平台查看,能否访问取决于网络环境

Higgsfield API 上线并开源18个月成果

Higgsfield 宣布 API 正式上线,自称市场上最便宜,并支持 Seedance 2.5 在美国地区使用面部输入,称无其他提供商能做到。同时开源了过去 18 个月构建的全部代码,发布在 GitHub 上。发起人另设 5 万美元奖金,征集真正有人用的竞品 demo,参与者需引用推文附上 demo,期限 7 天。

Higgsfield 把 API 和 18 个月的代码全开源了,还悬赏 5 万美元征集竞品 demo,做工具链和短剧批量生产的可以接 API 跑一周看成本。

点击打开原平台查看,能否访问取决于网络环境

Higgsfield 发布 API:一个接口集成 50+ 模型

Higgsfield 发布官方 API,一个接口集成 50 多个前沿模型,官方称价格低于订阅制,按量付费无承诺。上线 7 天内可在自选的 3 个模型上锁定最高 50% 折扣。入口为 open.higgsfield.ai。对需要批量调用多模型出图出片的团队,这是把生成能力接进自有流程、按用量控成本的一条路径。

一个 API 打包 50 多个前沿模型,按量付费不用订阅,7 天内锁定最高折扣。做批量出片、想把生成能力接进自己流程的团队可以先去 open.higgsfield.ai 看模型清单和单价。

点击打开原平台查看,能否访问取决于网络环境

阶跃星辰联合 ACE Studio 发布 StepAudio 3 Music

阶跃星辰(StepFun)与 ACE Studio 联合发布 StepAudio 3 Music,这是阶跃星辰首个音乐生成基础模型,可从提示词和歌词生成完整歌曲。支持歌曲生成、纯音乐生成、音乐翻唱、人声转歌曲调度四种工作流,基于 ABC-COT 先规划曲式结构再合成,用户可改写提示词、编辑 ABC 记谱迭代调整。交互式演示已上线,ABC-COT API 即将推出。

阶跃星辰首个音乐生成基础模型,支持整曲、纯音乐、翻唱、人声转调度四种工作流,还能改 ABC 记谱迭代调曲式。做短剧配乐和 AI 音乐后期的可以先去交互式 demo 试听。

点击打开原文,能否访问取决于网络环境

OpenAI 推出 Sponsored Agents 等广告工具

OpenAI 官方博客发布 AI 广告新体验,包括 Sponsored Agents、面向营销人员的工具,以及与 HubSpot、Shopify 的集成。这是 OpenAI 在广告商业化方向的产品发布,具体能力细节和上线范围需查看原文。

OpenAI 官方发布 AI 广告产品线,含 Sponsored Agents 及 HubSpot、Shopify 集成,做品牌投放和商业变现的制片人可以看看这套玩法怎么接。

Synthesia 发布实时交互数字人 API

Synthesia 发布 Interactive Avatar API,提供实时数字人能力:能听、能说、能实时回应,通过 LiveKit SDK 嵌入自有产品。开发者自带 LLM、知识库和业务逻辑,Synthesia 负责数字人层——声音、面部、口型同步。官方定位场景为 AI 销售代表、客服等实时对话应用。

Synthesia 把数字人做成可嵌入的实时 API,声音、面部、口型它包了,LLM 和知识库你自己接。做虚拟主播、AI 客服、互动角色的团队可以接 LiveKit SDK 跑一周看延迟。

点击打开原平台查看,能否访问取决于网络环境

Grok Voice 上线 fal:0.7 秒应答支持声音克隆

Grok Voice 已在 fal 平台上线,来自 @SpaceXAI 的语音模型,0.70 秒内应答,并在句子结束前完成工具调用;支持词级时间戳转录、25+ 种语言 30+ 种音色的文本转语音,以及用两分钟音频进行声音克隆。演示视频中每个声音都来自 Grok Voice。做 AI 配音、虚拟角色对话和实时字幕的团队可直接在 fal 上调用测试。

0.7 秒应答、句子没说完就能调工具,还带词级时间戳和两分钟音频克隆音色,做 AI 配音和虚拟角色对话的可以接 fal 跑一周看延迟稳不稳。

点击打开原文,能否访问取决于网络环境

网友发现 Prism 内可无限用 GPT-6 Astra

有 Reddit 用户 9 月 16 日报告,Codex 额度耗尽后,OpenAI 官方免费 LaTeX 编辑器 Prism 里的 GPT-6 Astra Extra High 仍可继续使用,疑似走独立 usage pool。官方文档写明 Free/Go/Plus/Pro 个人用户均可进入,内置 AI 助手由前沿模型驱动,但未标注具体额度。Prism 目前无终端、无本地文件系统、无 Git 集成。

OpenAI 官方 LaTeX 编辑器 Prism 疑似有独立额度池,Codex 用完后仍能调 GPT-6 Astra Extra High。搞工具链的可以研究下这个入口,但没终端没本地文件,暂时只能当个纯文本大脑用。

点击打开原文,能否访问取决于网络环境

Dreamina App 美国上线,Cast 一键生成 AI 分身

Dreamina 官方宣布 Dreamina App 正式在美国上线,同步推出 Cast 功能:几次轻触即可创建「AI Self」,可放入任意场景、风格或故事中。官方同步开启 #CastYourselfIn 挑战赛,TikTok、Instagram、X 三个平台各取点赞前 10 名,要求带 Dreamina 水印并打指定标签,获奖者得 30 天 Advanced 订阅,截止 9 月 20 日。Cast 可免费试用,邀请好友可解锁更多免费生成额度(限美国)。

Dreamina 独立 App 登陆美国,Cast 功能几次点击就能造出可放进任意场景和风格的 AI 分身,做角色 IP 和短剧的可以下载实测一下形象一致性。

点击打开原平台查看,能否访问取决于网络环境

OpenRouter 上线隐身模型 Union Alpha

OpenRouter 上线隐身模型 Union Alpha(@unionalphaai),定位多模态,面向研究、编程和 Agent 工作流,支持 256K 上下文与工具调用,官方称达到前沿级通用性能,目前免费开放试用并征集反馈。对做自动化流程和 Agent 调度的技术整合者来说,可接 API 实测其在批量任务和工具调用上的稳定性。

多模态、256K 上下文、支持工具调用,免费开放试用。做 Agent 工作流和自动化脚本的可以接 API 跑一轮,看它在批量任务调度上稳不稳。

小米 MiMo-V2.6 公开强化学习训练进展

小米 MiMo-V2.6 正处于强化学习训练阶段,团队从三方面扩规模:计算上每步约 2B tokens、1568 条 prompt 各做 16 次 rollout 且全异步;环境与 harness 上做多任务 agentic RL,单次运行混合多种 harness;评分上做 agentic 组内信用分配,结合测试用例与 rubric 奖励。团队称已研究 RL 能扩展到多远,未来几周逐步开源细节并直播训练过程。

小米 MiMo-V2.6 的 RL 训练细节:每步约 2B tokens、1568 条 prompt 各跑 16 次、全异步,还打算直播训练过程。做模型训练和 Agent 的可以蹲后续开源。

工具与能力

Tools

HeyGen 接入 MCP,一句提示词生成医疗视频库

HeyGen 推出 MCP 接入能力,可连接用户现有的工作环境,一句提示词即可生成整套视频库,覆盖每种就诊类型、每项手术、患者可能提出的每个问题,且所有视频保持同一张脸和同一个声音。适合需要批量产出系列化口播视频的场景。

HeyGen 把 MCP 接进你现有的工具里,一句提示词就能批量出一整套视频,同一张脸同一个声音贯穿所有条目。做批量口播、系列化内容的团队可以接上试一周,看角色一致性稳不稳。

点击打开原平台查看,能否访问取决于网络环境

Krea Agent 支持单视频生成多机位视角

Krea 官方账号发布 Krea Agent 新能力:从单一视频生成多个摄像机角度,推文附有示例和 prompt 链接。对需要多机位素材的编导和后期来说,这类能力可用于同一场景的视角扩展和剪辑素材补充,具体效果和参数需看官方示例。

Krea Agent 能从一段视频里生成多个机位视角,官方附了示例和 prompt。做分镜和后期多机位剪辑的可以点开看它怎么处理同一场景的不同角度。

点击打开原平台查看,能否访问取决于网络环境

OpenRouter 上线 shell:任意模型可跑代码

OpenRouter 宣布平台上的任意模型现在都能在托管的 Linux 容器里运行代码,产品名为 openrouter:shell。用法是在 Responses API 请求里加一个 tool,模型自己写脚本、执行、读回结果,无需本地安装或自建服务器。对做自动化素材处理、批量转写、脚本化剪辑流程的团队,这是把代码执行能力直接挂进现有 API 调用的一条路。

OpenRouter 给 Responses API 加了个 shell 工具,模型自己写脚本、跑、读结果,不用装环境不用自己搭服务器。做批量转写、自动剪辑脚本、素材处理的可以接上试试。

点击打开原平台查看,能否访问取决于网络环境

Meshy 上线 Ultra 4K,AI 3D 建模达 4K 几何分辨率

Meshy 官方宣布 Ultra 4K 正式上线,称其为首个达到 4K 几何分辨率的 AI 3D 建模功能,生成细节为 Meshy 历史最丰富水平,并附演示视频展示生成效果。对做 3D 资产、场景搭建、虚拟制片的视觉师来说,几何精度提升意味着模型细节更接近可直接使用的程度,值得实测生成结果能否顺畅进入后续流程。

Meshy 把 AI 建模的几何精度推到 4K,官方称细节为历史最丰富。做 3D 资产、场景搭建和虚拟制片的视觉师可以拿它试跑一遍,看模型细节能不能直接进下游流程。

点击打开原平台查看,能否访问取决于网络环境

Claude Design/Slides/Docs 接入 Claude Code

Claude Devs 宣布 Claude Design、Claude Slides、Claude Docs 三款工具已支持在 Claude Code 内使用。用户可要求生成设计评审幻灯片或 UI 原型,并指向仓库中的实际文件和 RFC,生成后可自行编辑,或在对话中继续修改并分享链接。属于 Claude Code 内的文档与设计产出能力扩展,面向有代码仓库上下文的开发与设计协作场景。

Claude Code 里现在能直接让它读仓库文件和 RFC 生成设计评审幻灯片或 UI 原型,改完还能分享链接。做产品向提案和视觉稿的可以试一下,纯拍片的用不上。

点击打开原平台查看,能否访问取决于网络环境

Runway 讲多版本广告工作流:一份素材出多色多语版

Runway 官方预告:9 月 29 日由技术美术 Anne-Isabelle "Leo" de Bokay 演示版本化工作流,用已拍素材生成不同配色、不同市场、三种以上画幅比例、两种以上语言的广告版本。适合需要批量产出投放变体的品牌与电商物料团队参考。

Runway 技术美术 9 月 29 日开讲版本化工作流,一份实拍素材拆出多配色、多市场、多画幅、多语言版本,做品牌投放和电商物料的可以蹲这场。

点击打开原文,能否访问取决于网络环境

方法与经验

Methods

GPT 6+Blender+Seedance 2.5 一镜到底工作流拆解

作者 @TanLuAI 分享用 GPT 6 + Blender + Seedance 2.5 做一镜到底 AI 视频的流程经验,认为难点已从镜头调度、人物走位转移到资产图准备和资产描点提示词撰写。他给出两个踩坑案例:场景图只传正面导致正反打镜头雷同,群众角色卡数量太少而画面人物过多导致克隆人。建议场景图尽量包含完整正反打画面并在提示词中标注正打/反打,群众角色卡要数量多、外貌各异,并用提示词限制人数(示例:固定出现 11 名围观平民,每名只出现一次,不复制人物填充背景)。

一镜到底的难点已经从镜头调度挪到资产图准备和描点提示词,作者把正反打场景图和群众角色卡的具体写法都贴出来了,做 AI 短剧和长镜头的可以照着改自己的提示词模板。

点击打开原平台查看,能否访问取决于网络环境

作者称视频完全由 Astra 控制 Blender 制作

创作者 ryanvogel 发布一支视频,称完全由 Astra 控制 Blender 制作,他本人只提供总体方向和故事情节,渲染、转场、跟踪(rotos、tracking)均由 Astra 完成,并附有完整视觉特效分解。对后期和特效团队来说,这是把 AI Agent 接进 Blender 这类专业三维软件、自动跑渲染与跟踪环节的一次实操展示。

作者只给方向和故事线,渲染、转场、跟踪全交给 Astra 驱动 Blender 完成,做后期和特效的可以点开看这套自动化能替掉多少手工活。

点击打开原平台查看,能否访问取决于网络环境

作者用 Astra 制作 F1 摩纳哥最后一圈影片

Derrick Choi 用 Astra 制作了一支 87 秒的摩纳哥大奖赛最后一圈影片,包含全部 22 辆 F1 赛车,渲染 2610 帧、4K 30fps。Codex 负责编写构建和动画化 Blender 场景的脚本,并用 Python 生成原创立体声音轨,覆盖引擎转速、换挡、超车和隧道混响,作者提到使用了 High reasoning 模式。

87 秒、22 辆 F1、2610 帧 4K 30fps,Blender 场景搭建和动画全靠 Codex 写脚本,连引擎转速、换挡、隧道混响的立体声也是 Python 生成的。做三维动画和后期声音的可以拆一下这套自动化流程。

点击打开原平台查看,能否访问取决于网络环境

面壁 VoxCPM2 驱动配音工具 Dubedo 支持 30 语种

开发者 @dubbedstudio 基于面壁智能 VoxCPM2 打造商用 AI 配音工作室 Dubedo,翻译本地化视频时保留每位说话者的音色身份。支持 30 种目标语言配音,通过参考音频做说话者专属声音克隆,采用缓存语音表征加无服务器 GPU 推理。从转录、翻译到说话者感知的语音生成与最终混音整合在一处,VoxCPM2 模型已在 Hugging Face 开源。

面壁 VoxCPM2 被开发者做成商用配音工作室 Dubedo,翻译视频时能保住每个说话者原本的音色,支持 30 种目标语言。做海外发行和短剧出海的后期可以拿自己的素材跑一遍,看音色还原到什么程度。

点击打开原平台查看,能否访问取决于网络环境

LumaLabsAI 用 Seedance 2.5 剪辑模式制作《Ichor》

Luma Labs 官方分享影像探索作品《Ichor》的制作流程,提到用 Seedance 2.5 的剪辑模式和新关键帧界面来提升表演贴合度、控制关键帧场景的节奏,直接控制让制作过程更快。

Luma 官方晒自家片子《Ichor》的制作流程,重点在 Seedance 2.5 的剪辑模式和新的关键帧界面怎么控表演和节奏。做 AI 影像的可以看它怎么用关键帧卡节奏。

点击打开原平台查看,能否访问取决于网络环境

Astra 借 Atlas 工作流在 Blender 搭出 GTA6 海滩别墅

作者用 GPT-6 驱动 Astra,配合 Atlas3DAI 工作流和 Tripo 3.1 制作 GTA 6 海滩别墅场景。流程为:给 Astra 概念图和 YouTube 链接生成参考图,用 Atlas MCP 导出并按 prompt 自动重命名,再喂进 Atlas Batch Composer 一次性批量跑 3D 生成,最后让 Astra 把 70 个高模按形体优化到 5K 或 1K 三角面并导入 Blender 重建房屋。作者提到单靠 Blender MCP 跑 Astra 只能用基本几何体搭资产,Tripo P2 低模效果不达预期,最终选 Tripo 3.1 换细节。

一条把 3D 资产从概念图到进 Blender 全自动跑通的实测:70 个高模、Tripo 3.1 出细节、Atlas Batch Composer 批量生成。做场景和美术的可以照着搭一遍。

点击打开原平台查看,能否访问取决于网络环境

PixVerse 演示 GPT Image 2.5 姿势表接 Seedance 动画

PixVerse 官方账号演示了一条角色动画流程:先用 GPT Image 2.5 生成九帧连续姿势表,做到同一张脸、同一套服装,再放到 PixVerse 上用 Seedance 驱动成动画。这条的价值在于把「姿势表定角色一致性 + 视频模型驱动」拆成了两步可复现的做法,做角色动画、短剧分镜和视觉开发的可以按这个顺序跑一遍,验证姿势表对角色一致性的约束效果。

九帧姿势表同一张脸同一套服装,再丢进 Seedance 让它动起来——做角色动画和短剧的可以照这个顺序试一遍,重点看姿势表能不能压住角色一致性。

点击打开原平台查看,能否访问取决于网络环境

GPT-6 Astra 与 Scenario MCP 用 9 张手机照重建 3D 房间

Scenario 官方演示:用 GPT-6 Astra 加 Scenario MCP,把办公室 9 张手机照片转成完全可交互的 3D 房间。Astra 负责理解空间布局并在 Blender 里重建几何体,Scenario MCP 从照片中提取地毯、木材、金属等真实材质,全程无测量、无扫描,一小时后即可在 3D 中漫游实际办公室。

9 张手机照片、无测量无扫描,一小时重建出能走进去的办公室 3D 场景,做虚拟制片和场景预演的视觉师可以试这套流程。

点击打开原平台查看,能否访问取决于网络环境

AI 空镜 B-Roll 提示词 25 条值得生成

Luma AI 官方博客发布《AI B-Roll Prompts: 25 Filler Shots Worth Generating》,整理 25 条用于生成 B-Roll 空镜/填充镜头的提示词。B-Roll 是叙事片里承担转场、氛围铺垫和节奏缓冲的辅助镜头,这类素材通常需要批量产出。原文未展开具体提示词内容与适用模型版本。

25 条可直接套用的空镜提示词,做短片和短剧的可以存下来当转场素材库,省掉每次现想 prompt 的时间。

点击打开原文

TechHalla 分享 GPT Image 2.5 与 Seedance 2.5 提示词

TechHalla 发布一条 AI 视频片段,主题为「即使在最恶劣的条件下也要保持冷静」,制作工具为 GPT Image 2.5 加 Seedance 2.5,提示词附在链接中。推文正文仅含主题句和工具署名,未展开具体画面内容与参数。

推文只给了「最恶劣条件下保持冷静」这句主题和工具组合,成片和提示词都在链接里,做视觉和短剧的可以点开看这套 GPT Image 2.5 出图接 Seedance 2.5 出片的搭配效果。

点击打开原平台查看,能否访问取决于网络环境

作品与案例

Works

AI 配音 Jony Ive 版 iPhone Duo 宣传片

X 用户 @L0vetodream 转载 B 站 FreeFromStudio 的 iPhone Duo 概念宣传片,片中旁白由 AI 模仿 Jony Ive 的声音完成,配文称「这下味道就对了」。作品属概念广告向短片,看点集中在 AI 语音克隆对特定人物口音、停顿和语调的还原度。做 AI 配音、虚拟代言和仿品牌广告的可以拉片听一遍语气处理。

用 AI 复刻 Jony Ive 的英式旁白腔调给假想产品配宣传片,做 AI 配音和仿品牌广告的可以拉一遍听语气节奏。

点击打开原平台查看,能否访问取决于网络环境

微信公众号 光影漫游AI 二维码
觉得日报有用的话,欢迎关注微信公众号,AI 影视创作的内容都在那里。
光影漫游AI
微信内长按二维码识别,或复制名称到微信搜索