← 全部日报

AIGC 信息日报

2026 年 8 月 22 日 周六

行业与平台

Industry

Runway 发布 Ruby:SDR 视频转 16-bit HDR

Runway 官方发布新模型 Ruby,可将 SDR 视频转换为最高 16-bit HDR,输出支持 ProRes 和 EXR 序列格式,兼容任何已上传视频或生成的输出,最长支持 30 秒素材。对后期和视觉师来说,这意味着调色和合成环节可以直接在 Runway 内完成 HDR 升级,无需额外软件,工作流更顺。

后期和视觉师直接受益,把普通 SDR 素材一键升到 16-bit HDR,ProRes 和 EXR 序列都支持,调色和合成的工作流能省一大截,接 API 测一周看效果。

点击打开原平台查看,能否访问取决于网络环境

Pika 发布 3B 语音模型,1.2 秒生成一分钟 48kHz 语音

Pika 官方发布 Pika Speech,3B 参数文本转语音模型,RTF 0.02。本地长文本测试中,生成一分钟 48kHz 工作室级语音约需 1.2 秒,支持最长五分钟的请求。

做配音和短剧后期的可以关注,本地跑长文本语音效率很高,一分钟 48kHz 语音只要 1.2 秒,支持最长五分钟请求,接进自己的配音工作流试试。

点击打开原文,能否访问取决于网络环境

DeepSeek 发布 V4-Flash-Vision-Exp 多模态模型

DeepSeek 推出实验性多模态模型 V4-Flash-Vision-Exp,已上线 API 平台,文本能力与 V4-Flash 持平,覆盖智能体、推理与世界知识;在多模态智能体基准上较 V4-Flash 大幅提升,性能接近 Opus-4.8。同日发布 DeepSeek Harness 0.1.1,开箱支持新模型。对创作者来说,这是视觉理解/智能体方向的研究型发布,不直接生成图像或视频,与 AI 影视制作工作流关联有限。

多模态智能体基准上逼近 Opus-4.8,但这是研究向的视觉理解模型,不直接产出图像视频,做片子的人用不上,搞工具链集成的可以看一眼 API。

点击打开原文,能否访问取决于网络环境

Cola 上线多模态小参数模型 Ox,限时免费

Cola 上线全新多模态模型 Ox,小参数、强后训练,官方称能力对标 Terra 级别、速度对标 flash,目前限时免费体验。beta 阶段无技术支持且可能存在一定问题,官方在帖子集中收集反馈。

多模态小参数模型,主打 Terra 能力级别加 flash 速度,目前限时免费,做 AI 短剧和视觉的可以上手试一轮,看小参数模型出片效率值不值。

点击打开原文,能否访问取决于网络环境

Luma 预告面向创意人的 Agent 产品

LumaLabs 官方预告将推出面向创意专业人士的 Creative agents 产品,将于 9 月 14 日在与 GMI Cloud 合作的 Summer Signal 活动上正式亮相。目前仅发布预告。

Luma 官宣要出面向创意人的 Agent,9 月 14 日 Summer Signal 上发布。做视觉和短剧的可以蹲一下,看它能不能把生成、编辑、批量的活串起来。

点击打开原文,能否访问取决于网络环境

Inkling 系列模型上线 OpenRouter 免费供 Agent 调用

OpenRouter 宣布 Inkling 与 Inkling Small 两款开源权重 MoE 推理模型上线,由 @thinkymachines 直接托管,在 agentic harnesses 内免费使用,可接入 Claude Code、Codex、Hermes Agent 等工具,模型原生支持文本、图像、音频多模态。对 AIGC 技术整合者来说,这是把多模态推理能力免费接进自动化创作工作流的机会,但纯影视创作向的编导、视觉、后期团队与这条关系不大。

OpenRouter 直接托管 Inkling 和 Inkling Small,开源权重 MoE 推理模型,原生支持文本、图像、音频,可免费接入 Claude Code、Codex 等 Agent 工具。做 AI 工具链整合的可以接上试试,纯创作向的这条路过。

点击打开原文,能否访问取决于网络环境

工具与能力

Tools

阿里 Wan 模型:一份 18 页 PDF 直接生成 30 秒广告

阿里 Wan 官方账号发布演示:输入一份 18 页 PDF,单次运行即可生成一支完整的 30 秒商业广告。核心卖点是「文档直接驱动成片」的自动化能力,面向商业广告与品牌短片场景。

官方演示从 18 页 PDF 一次跑出 30 秒完整广告,做商业短片和广告的可以蹲一下具体工作流,看品牌物料到成片的自动化程度。

点击打开原文,能否访问取决于网络环境

OpenAI 新功能上线 API 并覆盖 Work 与 Codex 额度

OpenAI 官方宣布一项新功能现已开放 API 调用,并逐步向 ChatGPT Work 和 Codex 额度的合格套餐推送。Pro、Plus、Business 订阅用户的使用方式保持不变。

OpenAI 官方宣布新能力开放 API 调用,并逐步覆盖 ChatGPT Work 和 Codex 额度,做自动化创作流程的可以接 API 试跑,Pro/Plus/Business 订阅不受影响。

点击打开原文,能否访问取决于网络环境

Runway Ruby 上线 Max 与企业版,支持 16-bit EXR 序列

Runway 官方宣布 Ruby 功能现已面向 Max 订阅和企业版开放。该功能可将任意视频生成或转换为 16-bit EXR 序列,或 10-bit、12-bit 的 ProRes 与 HEVC 格式,支持 BT.2020 色彩空间及 PQ、HLG 曲线。对后期和调色工作流是直接利好,高动态范围素材的交接和存档更专业。

后期和调色团队可以直接上手:把任意视频转成 16-bit EXR 序列或 10/12-bit ProRes,BT.2020 色彩空间带 PQ/HLG,接达芬奇调色流程会顺很多。

点击打开原平台查看,能否访问取决于网络环境

HeyGen Look Packs:换装换场景保持同一张脸

HeyGen 推出 Look Packs 功能,可同时更换数字人的服装和场景,同时保持面部特征不变。官方演示覆盖房地产、法律、健身、教育、健康等多个行业场景,同一人物形象可复用于不同行业广告素材。

做数字人广告和品牌代言的团队可以实测:同一张脸换装换场景,客户每次点开都是同一个人,省掉反复拍摄和后期换脸的成本。

点击打开原平台查看,能否访问取决于网络环境

FLUX 视频放大上线 OpenRouter,可升 2K/4K

OpenRouter 上线 @bfl_ai 的 FLUX Video Upscale,可将任意视频放大至 2K 或 4K 分辨率,面部更清晰、纹理更干净、背景细节更丰富,同时保持自然的动态与真实感。对后期和视觉师来说,这意味着低清素材可以直接通过 API 升级,省去传统修复流程,适合批量出片和素材增强场景。

后期和视觉师可以直接接 API 用,把低清素材一键升到 2K/4K,面部和纹理细节提升明显,做短剧批量出片时能省一道修复工序。

点击打开原平台查看,能否访问取决于网络环境

Ox Alpha 上线 OpenCode Go,6 天免费不限量

OpenCode 宣布 Ox Alpha 模型上线 OpenCode Go 平台,未来 6 天内使用近乎无限且完全免费,不占用 Go 套餐额度。对 AIGC 技术整合者来说,这是接入自动化创作工作流(批量生成、媒体处理)的免费测试窗口,可低成本验证模型在创作链路上的表现。

OpenCode Go 用户直接可用,6 天免费不限量,做自动化剪辑/转写链路的可以趁这波白嫖测一轮。

X Ads 推出 MCP 接口,AI 智能体可管理广告

X Ads 推出 MCP 接口,实现 agent-native,Grok、Claude Code 等 AI 智能体可直接连接广告账户,用自然语言管理广告系列。该 MCP 提供 23 个工具,支持创建与管理广告、定向设置、推广帖子等全流程操作。新广告系列默认以暂停状态创建,需用户明确激活后才会开始花钱,防止 AI 擅自消耗预算。

做 AI 短剧和内容 IP 的团队,如果靠 X 投流,这个接口能让 Grok、Claude Code 直接管广告账户,省掉手动操作,值得接上试试。

点击打开原平台查看,能否访问取决于网络环境

Midjourney alpha 网站更新:新增文件夹分组与修复

Midjourney 发布 alpha.midjourney.com 两周内第二轮更新,修复大量 UX 问题并新增文件夹分组功能。用户可在侧边栏将项目整理为可折叠树状分组,支持双击重命名;Upscale、Zoom、Vary 功能回归,Vary 现在遵循用户设置而非静默运行 HD。设置项不再自动重置,站点卡顿、编辑器遮挡、提示词粘贴损坏等问题均已修复。

Midjourney 官方两周内第二轮 alpha 更新,侧边栏新增可折叠文件夹分组、双击重命名,Upscale/Zoom/Vary 回归且 Vary 遵循用户设置。视觉师和美术总设整理大量项目素材时能省不少事,做系列作品管理的可以上手试试。

点击打开原文

OpenRouter 新 API 支持 Agent 自动成本审查

OpenRouter 推出新 API,支持 agentic 分析:给编码 Agent 一个管理密钥和 openrouter-analytics 技能,即可自动执行成本审查。内部实测发现一个预览模型每月消耗约 6200 美元,约为混合费率 25 倍,并追踪到 98% 的成本来源。该能力面向模型调用成本监控与优化场景。

OpenRouter 开放了让编码 Agent 自动跑成本审查的 API,内部用它揪出一个预览模型每月烧掉约 6200 美元。做 AI 工具链整合的可以接上这套分析能力,帮团队盯住模型调用成本。

方法与经验

Methods

MiniMax H3 演示:任意视频生成新机位

MiniMax H3 新能力演示:从任意视频生成全新机位,无需重拍,保持同一场景与表演,可切换不同视角。推文附有 prompt 拆解。对编导和短剧团队来说,这意味着分镜调度和补拍成本大幅降低,值得实测。

做短剧和编导的可以拉片看:同一场戏不重拍,直接换机位,镜头语言调度省一大截。

点击打开原平台查看,能否访问取决于网络环境

Glif 实测 20 款视频模型角色声音一致性

Glif 团队在自家平台实测 20 款视频模型,用同一角色面孔、不同场景,检验声音是否保持一致。测试覆盖主流视频生成模型,结果以对比形式呈现。对 AI 短剧和配音团队来说,这是选型参考,能直接看出哪些模型在跨场景时能稳住角色声音,减少后期配音对轨成本。

做 AI 短剧和配音的可以收藏这份实测,20 款模型同脸换场景测声音是否变化,选模型前先看结论。

点击打开原平台查看,能否访问取决于网络环境

Seedance 2.5 动作喜剧短片:双角色身份参考与镜头规则

创作者 Pyona 用 Seedance 2.5 在 Newtake 平台生成 30 秒 16:9 横屏 4K 24fps 超写实动作喜剧短片。公开的 prompt 包含:两张上传图片作为男女主角身份参考(严格保持脸部、五官、发型、体型、服装一致),5 次脸颊轻吻作为喜剧节奏点,镜头规则要求轻吻时用同一连续镜头的 camera push-in 推进到 close-up,禁止动漫感、游戏 CG 感、慢动作。

创作者用 Seedance 2.5 生成 30 秒动作喜剧短片,公开了完整 prompt:双角色身份参考、5 次轻吻节奏点、镜头推进规则。做短剧和动作戏的可以直接套这套 prompt 跑一遍看效果。

点击打开原平台查看,能否访问取决于网络环境

DeepSeek 发布多模态实验模型 v4-flash-vision-exp

DeepSeek 官方介绍 DeepSeek-v4-flash-vision-exp 实验模型,支持图像与文本多模态输入,可描述图片、读取截图文字、分析图表。支持 JPEG、PNG、GIF、WebP 格式,格式按文件内容自动识别。提供三种传图方式:Base64 内联编码、公开 http(s) 链接(URL 限 8192 字符、文件限 32 MiB、60 秒内下载完成)、Files API 上传引用,均兼容 OpenAI Chat Completions 与 Responses API 格式。

DeepSeek 补上多模态短板,能看图读字分析图表,API 兼容 OpenAI 格式,做 AI 工作流整合的可以接上试试,视觉师可当辅助工具用。

点击打开原文

Magnific 用 Seedream 5.0 Pro 角色参考驱动 Seedance 2.5

Magnific 官方演示:用 Seedream 5.0 Pro 生成角色,再作为参考图喂给 Seedance 2.5 生成动画,实现跨模型角色一致性。所有提示词和角色图已公开,由 BytePlusGlobal 提供算力支持,现已上线 Magnific 平台。

官方演示了「Seedream 5.0 Pro 建角色 + Seedance 2.5 做动画」的完整工作流,角色一致性是看点,视觉师和短剧团队可以照着跑一遍。

点击打开原平台查看,能否访问取决于网络环境

Artificial Analysis 推 Speech Agent Arena 评测语音模型

Artificial Analysis 推出 Speech Agent Arena,用真人对比评测语音到语音模型,衡量对话偏好与任务成功率。偏好榜 Gemini 3.1 Flash Live Preview - Minimal 以 1046 Elo 居首,任务成功率由 Grok Voice Think Fast 2.0 High 以 94.7% 领先。评测覆盖 15 个需调用工具的智能体场景(如点外卖)和 20 个非智能体场景(如询问营业时间),通过真人实时对话后投票拟合偏好 Elo 分。

做 AI 配音、虚拟角色对话和实时语音交互的团队,这份榜单直接告诉你哪个语音模型用户更爱聊、任务成功率更高,选型前值得扫一眼。

点击打开原文,能否访问取决于网络环境

Sol-Engine 将 MiniMax H3 推理加速 22 倍以上

Sol-Engine 团队官方介绍 MiniMax H3 超级加速方案,在单张 NVIDIA GB200 上,5 秒 768p 视频生成从 152.3 秒降至 6.85 秒(22.2× 加速),10 秒视频达 27.7× 加速,对比已发布的 SGLang 基准。按 MiniMax 官方 API 价格折算,理想满载下单卡每小时可服务约 525 条 5 秒视频,对应约 210 美元/小时产值,单卡月产 37.8 万条 5 秒视频。

推理加速直接换算成成本账:单张 GB200 一天能出 1.26 万条 5 秒视频,做短剧批量生产的制片可以算算自己的单位成本能压到多少。该产品的发布我们已在 2026-08-01 报过,这条是官方对已有能力的介绍,不是新上线。

点击打开原文,能否访问取决于网络环境

创作者分享电影级动作短片提示词模板

创作者澜森分享一套真人电影级实拍质感动作短片的提示词模板,约13秒,强调 ARRI Alexa 35 级别电影质感、真实皮肤布料金属与风压雨雾,要求镜头焦点、光线方向、受力反馈连续可读,允许少量超现实能力但必须真实照亮人物与环境。角色设定示例为「赤凰」:东亚女性,红色旗袍,可将身体解构为黑色羽鸟重组。

一份能直接套用的电影级动作短片提示词模板,从摄影质感、镜头逻辑到角色设定都写得很细,做 AI 短剧和视觉的可以拿去改角色和场景直接跑。

点击打开原平台查看,能否访问取决于网络环境

Luma 官方 12 条 UGC 风格广告视频 Prompt 示例

Luma AI 官方博客发布 12 条 UGC 风格 AI 视频 prompt 示例,面向 DTC 品牌和创作者广告场景。每条示例针对 UGC 广告的镜头语言、口播节奏和产品展示方式设计,可直接套用或改写。

做 DTC 广告和电商素材的可以直接抄这 12 条 prompt 模板,省得自己调半天。

点击打开原文

小红书博主分享商单报价与起号工作流

小红书博主分享水上商单收入约 2w/月,万粉账号图文视频报价 2k-5k,平台抽 10% 平台费,中介单另返 20%-40%,到手约 65%。另开源一套 10 个 skill 的小红书起号工作流,覆盖定位、选题、写作、视觉、复盘五个环节,含账号体检、笔记复盘等工具。

做小红书商单变现的可以看报价分成细节,想用 AI 起号的可以试这套开源 skill 工作流。

点击打开原文,能否访问取决于网络环境

作品与案例

Works

黑神话咕嘎终极典藏版:AI 重走六回主线

B 站 UP 主用 updream 平台制作的《黑神话咕嘎》终极典藏版,完整重走黑神话六回主线(黑风山至花果山),新增结局,重点展示场景、首领、头目、小妖、装备等元素。作者自述多角色同时出场时 AI 抽卡废片率过高,花果山内容因预算限制未能充分展开。

AI 长片系列完整成片,六回主线加新结局,做 AI 短剧的可以拉片看多角色同屏和场景还原怎么处理,作者也直说了废片率高的坑。

点击打开原平台查看

AI 电影感口红广告致敬布达佩斯大饭店

新片场 AIGC 分类下的 AI 广告短片,以《布达佩斯大饭店》为视觉母题,用 AI 生成一支电影感口红广告。短片主打韦斯·安德森式对称构图、粉彩色调与复古质感,将商业产品植入高度风格化的影像叙事中。

用 AI 复刻韦斯·安德森对称构图和粉彩配色做商业广告,视觉师和编导可以拉片看风格化转译和产品植入怎么平衡。

AI 将红警2 改编成 22 分钟长片

创作者 @EHuanglu 用 AI 将经典游戏《红色警戒2》改编成长片,属于游戏 IP 的 AI 影视化改编案例,可拆解其叙事节奏、镜头语言与游戏素材的视觉转译方式。

把经典游戏红警2 用 AI 重做成长片,做 AI 短剧和长片的可以拉片看游戏 IP 改编的叙事和视觉处理。

点击打开原平台查看,能否访问取决于网络环境

微信公众号 光影漫游AI 二维码
觉得日报有用的话,欢迎关注微信公众号,AI 影视创作的内容都在那里。
光影漫游AI
微信内长按二维码识别,或复制名称到微信搜索