← 全部日报

AIGC 信息日报

2026 年 9 月 2 日 周三

行业与平台

Industry

World Labs 发布世界模型 Atlas,支持 1 分钟 1440p 生成

World Labs 发布新一代世界模型 Atlas,从零预训练,原生处理文本、图像、视频和 3D,架构为多模态自回归扩散 Transformer,输入以 3D 姿态形成空间上下文。支持相机控制生成(最长 1 分钟 1440p 视频)、稀疏视图 3D 重建、时空仿真和图像生成,在相机控制生成与 3D 重建任务上优于更专用的模型,现已开放早期访问申请,未来将驱动 Marble 等产品。

从零预训练的多模态世界模型,原生吃文本/图像/视频/3D,相机控制生成最长 1 分钟 1440p 视频,做 AI 影像和空间叙事的可以申请早期访问实测镜头控制能力。

点击打开原文

Claude Fable 5.1 上线,缓存读取降价 75%

Anthropic 发布 Claude Fable 5.1,已上线 Claude Code 和 Claude Platform,定价与 Fable 5 持平,API 缓存读取降价 75%。模型在长任务中能更久自主推进、更善于提示用户它已卡住,写作风格也更自然。同期发布的还有 Claude Mythos 5.1,官方称其为编码与知识工作领域最先进的模型。

Anthropic 新模型上线,长任务自主推进和卡住自报能力提升,做 AI 短剧批量生产或搭自动化工作流的可以接 API 测一周,缓存读取降价 75% 对高频调用是真省钱。

点击打开原平台查看,能否访问取决于网络环境

Google 推出 Gemini 智能体视频理解能力

Google DeepMind 官方博客宣布推出 Gemini 的智能体视频理解能力(agentic video understanding),核心是让 AI 能像智能体一样理解视频内容并执行任务。官方发布,具体技术细节和 API 接入方式需查看博客原文。对 AI 后期和工具链整合者来说,这类能力有望接入自动化剪辑、内容审核或视频检索流程,值得跟进。

Google 官方发布 Gemini 的智能体视频理解能力,做 AI 后期和工具链整合的可以关注 API 接入,看能否把视频内容理解串进自动化剪辑或审核流程。

点击打开原文

Claude 新模型基准测试得分超 Fable 5 两倍

Claude 官方发布新模型基准测试结果:在 Terminal-Bench-Science 0.1 上得分 52.6%,是 Fable 5 的两倍多;在 Terminal-Bench 4.0 上得分 55.8%,Fable 5 为 42.0%。

官方基准数据,Terminal-Bench-Science 得分是 Fable 5 的两倍多。对创作工作流影响有限,搞 AI 编程和 Agent 自动化的可以看一眼。

点击打开原文,能否访问取决于网络环境

Google 推出 Pics:Workspace 内图像生成与编辑

Google 官方发布 Google Pics,定位为 Workspace 内的图像创建与编辑工具,支持在 Docs、Slides 等办公套件中直接生成和修改图片。官方展示了多张由 Pics 生成的图片拼贴。

Google 把图像生成和编辑直接塞进 Workspace,做视觉和内容生产的可以关注它跟 Docs/Slides 的联动,看能不能省掉来回切工具的流程。

点击打开原文

Visko 发布 Orbis 1.0,官方称首个 Live Model

Visko 团队发布 Orbis 1.0,定位为首个 Live Model,可实时流式生成可交互的动态世界,支持持久记忆、交互性和基于物理的无边界长度生成。DAIR.AI 的 Elvis Saravia 转评称实时生成交互世界的模型已到来,强调其交互、物理基础和持久记忆可带来全新体验。

实时流式生成可交互世界,带持久记忆和物理基础,做虚拟场景和互动叙事的可以关注,看能不能接进自己的创作流程。

点击打开原平台查看,能否访问取决于网络环境

Fable 5.1 发布:代理编码成本减半

Felix Rieseberg 发布 Fable 5.1 和 Mythos 5.1 两款模型。Fable 5.1 在代理编码任务上成本约为 Fable 5 的一半,写作风格更自然。对依赖 AI 编程 Agent 自动化创作流程的团队,成本降低是直接利好。

做 AI 短剧和批量生产的团队,如果依赖 Agent 自动化流程,这个成本减半值得关注,能省不少预算。

点击打开原文,能否访问取决于网络环境

Meta 发布实时音频感知模型 Muse Voice Transcribe

Meta Superintelligence Labs 发布 Muse Voice Transcribe,定位首个实时音频感知模型,支持实时流式 ASR、20+ 说话人 diarization 和 endpointing,多语言且可无缝 code-switching,可通过语言、关键词和上下文偏置提升准确率,在 Artificial Analysis 流式语音转文本和公开 diarization 基准上排名第一。对后期和短剧团队来说,实时多说话人转写加自动断句,能直接接进字幕生成和粗剪对白的工作流。

做 AI 短剧和后期字幕的可以关注,实时流式转写加 20+ 说话人区分,多语言混说也能切,接 API 能省掉不少人工听写和对轨的活。

点击打开原文,能否访问取决于网络环境

Mercury 2.5 推理模型上线 OpenRouter,速度 1107 tokens/秒

OpenRouter 宣布 Mercury 2.5 Preview(来自 @_inception_ai)独家上线,通过并行 token 生成达到 1107 tokens/秒,支持可调推理深度、并行工具调用和 schema 对齐 JSON,面向延迟敏感型工作负载。对 AIGC 技术整合者来说,这是把高速推理接进批量生成、实时字幕等创作自动化流程的现成 API 选项。

推理速度拉到 1107 tokens/秒,做 AI 短剧批量生成、实时字幕这类对延迟敏感的创作流程,可以接 OpenRouter 的 API 实测一周看吞吐提升。

点击打开原平台查看,能否访问取决于网络环境

Flick 首映 17 位电影人 AI 原创作品

Flick 平台宣布 17 位电影人的 17 部原创 AI 作品今日集中首映,强调无剧组、无大预算的制作模式,作品已可在 FLICK.ART/TV 观看。该活动展示了个人创作者在无传统剧组配置下完成 AI 影像创作的可能性,适合关注独立 AI 创作生态的编导和短剧团队参考其作品风格与制作规模。

Flick 平台集结 17 位电影人、17 部无剧组无大预算的 AI 原创作品集中首映,做 AI 短剧和独立创作的可以点进去看这批作品的成色和风格取向。

点击打开原平台查看,能否访问取决于网络环境

MiniMax H3 创意大赛开放:奇异生物叙事短片赛道

MiniMax Design 官方宣布「Bestiary:Miora × MiniMax H3 创意大赛」开放,单一赛道为奇异生物叙事短片,题材涵盖神话、民间传说、都市传说或原创世界观。奖品包括 8000 美元现金、Miora Design 平台 20 万创作积分,以及一二三等奖和 10 个人气奖。

MiniMax 官方联合腾讯 Miora 办创意大赛,奖金 8000 美元加 20 万创作积分,赛道是奇异生物叙事短片,做 AI 短剧和编导的可以当练手和曝光机会。

点击打开原平台查看,能否访问取决于网络环境

工具与能力

Tools

Magnific 角色参考图功能:每帧保持同一张脸

Magnific 官方演示角色参考图功能:将角色设定图(脸、眼镜、毛衣、波点)作为参考输入,每次生成都能保持完全一致。示例 prompt 为「羊毛毡定格动画女性角色参考图,纯白无缝背景」。该功能面向 AI 动画和短剧制作中的角色一致性需求。

做角色一致性的视觉师可以点开看,官方演示了用一张角色参考图(脸、眼镜、毛衣、波点)在每次生成中保持完全一致,对 AI 动画和短剧的角色稳定很有参考价值。

点击打开原文,能否访问取决于网络环境

Luma 推出 FLUX Video Upscale 视频升到 2K/4K

LumaLabs 官方发布 FLUX Video Upscale,可将视频提升至 2K 和 4K 分辨率,面向已有视频素材的超分处理场景。对后期和视觉团队来说,这意味着成片放大可以留在 Luma 生态内完成,减少外部工具切换。

Luma 官方上线视频超分工具,能把成片直接拉到 2K/4K,后期和视觉团队可以接进现有工作流,省掉外部放大步骤。

点击打开原平台查看,能否访问取决于网络环境

Runway Ruby 支持 ACES 色彩空间导出 EXR 序列

Runway 官方宣布 Ruby 新增 ACES 支持,可导出场景参考(scene-referred)、半浮点(half-float)EXR 序列,支持 ACEScg 1.3 和 2.0 两种色彩空间标准,输出可直接接入专业后期合成与调色流程。对 AI 后期和视觉师来说,这意味着 AI 生成画面能更无缝地进入 Nuke、达芬奇等专业调色合成工作流,减少色彩空间转换带来的精度损失和额外步骤。

做 AI 后期和调色的可以接上这条:Ruby 现在能导出 ACEScg 1.3/2.0 的 EXR 序列,直接进 Nuke/达芬奇工作流,省掉转色彩空间的麻烦。

点击打开原平台查看,能否访问取决于网络环境

Gemini Notebook 短视频概览支持 70+ 语言

Gemini Notebook 的 Short Video Overviews 功能新增支持 70 多种语言(含 3 种全新英语变体),可将来源内容自动转化为约 60 秒的竖屏视频,并适配用户偏好语言。该功能面向 Ultra 和 Pro 用户,即将在网页端和移动端上线。

做多语种短剧和海外分发的团队可以关注,一条素材自动转成 60 秒竖屏多语言版本,省掉重新配音和字幕的功夫。

点击打开原平台查看,能否访问取决于网络环境

Perplexity Computer上线Claude Fable 5.1,Pro及Max可用

Perplexity 宣布 Claude Fable 5.1 已上线 Perplexity Computer,面向 Pro 和 Max 订阅用户开放。官方称其在 8 月 WANDR 评测中排名第一,得分 0.601,每任务成本 12.76 美元,较 Fable 5 分数提升 21%、成本降低 37%。

Perplexity 把 Claude Fable 5.1 接进 Computer 了,Pro 和 Max 用户直接能用。做 AI 编程和自动化工作流的可以实测一下,官方数据说比 Fable 5 分数高 21%、成本低 37%。

点击打开原文,能否访问取决于网络环境

OpenRouter 发布 Render Workflows 使用指南

OpenRouter 推出 Render Workflows,支持 Node 和 Python,通过 `render workflows init` 初始化项目、`render workflows start runPromptBatch` 运行批量任务,本地开发用 `render workflows dev`,部署用 `render workflows create`。面向需要批量调用模型 API 的自动化场景。

做批量出图、批量转写这类重复任务的,可以用 Render Workflows 把流程串起来跑,省掉手动一个个点。

点击打开原文,能否访问取决于网络环境

方法与经验

Methods

MiniMax H3 Max 支持 12 个参考图,角色场景跨全片保持一致

MiniMax H3 Max 主打跨全片参考一致性:角色和场景在整部影片中保持不变,单次生成仅需 10 秒,最多支持 12 个参考图。推文附带了具体的参考图设置方法链接,面向长片和短剧制作场景,解决多镜头下角色和场景漂移问题。

做 AI 短剧和长片的重点看这条:角色和场景跨全片保持一致,10 秒出图,最多 12 个参考。点开链接看具体怎么搭参考图,直接套进自己的角色一致性工作流。

点击打开原平台查看,能否访问取决于网络环境

World Labs 新模型可从新角度重拍现有视频

World Labs 新模型支持从全新角度重拍现有视频。演示中,初始片段由三台手机在三脚架上拍摄,模型重建了场景的完整视角,从而实现对视频的重新取景。该能力对后期重构图、补拍和分镜调整有直接价值。

World Labs 新模型能从任意新角度重拍现有视频,三台手机拍的素材就能重建全场景。做后期和编导的可以关注,这直接改变补拍和分镜的玩法。

点击打开原平台查看,能否访问取决于网络环境

一人用 Krea 制作电影《The Magic Needle》入选奖学金

Krea 官方分享电影《The Magic Needle》案例:创作者 Tedra 一人完成编剧、导演、生成与剪辑全流程,作品入选 a16z Cultural Leadership Fund x MACRO Epigraph Fellowship。官方附有她的创作过程说明。

一人包办编剧导演生成剪辑的完整 AI 电影案例,还拿了 a16z 奖学金,做 AI 长片和短剧的可以点进去看她的全流程怎么拆的。

点击打开原平台查看,能否访问取决于网络环境

Seedance 画幅比扩展技巧:官方宣传片多版本适配

创作者分享用 Seedance 将视频扩展成不同画幅比的技巧,用于前滩生活节官方宣传片的多版本制作。传统做法是在原素材上下或左右添加平面包装撑满画幅,重做开销大;改用 Seedance 转换画幅比后效果可行,Prompt 已放在评论区。

做线下大屏投放的团队可以直接抄作业,用 Seedance 扩展画幅比省掉重做成本,Prompt 在评论区,跑一遍就知道效果。

点击打开原平台查看,能否访问取决于网络环境

Pika 实测三模型同输入出片对比

Pika 官方用同一支「包里有什么」广告脚本,在相同输入下分别跑 Gemini Omni 1.1 Flash、Seedance 2.5 和 Wan 3.0 三个视频模型,对比三家对同一叙事脚本的呈现差异。适合做视觉风格和模型选型参考。

同一支包袋广告脚本分别跑 Gemini Omni 1.1 Flash、Seedance 2.5 和 Wan 3.0,做视觉和短剧的可以直接拉片看三家在叙事和质感上的差异,选型参考价值高。

点击打开原平台查看,能否访问取决于网络环境

创作者拆解AI角色视频逼真流程

创作者 Abdul Șhakoor 发布一条推文,承诺从头到尾完整拆解 AI 角色视频的逼真制作流程,以长推文形式分享。具体步骤、工具和参数尚未在推文正文中展开,需查看完整内容。

做AI角色视频的可以蹲这条完整流程拆解,从零到成片,视觉师和短剧团队直接当工作流模板用。

点击打开原平台查看,能否访问取决于网络环境

开发者用 fal H3 Max 搭建生成式视频课堂

开发者 @internetphysics 用 fal 平台的 H3 Max 模型构建了一个生成式视频课堂:输入任意概念,几秒内生成由虚拟角色 Tung Tung Tung Sahur 教授的动画讲解视频,支持排队生成新视频、观看时追问后续问题,课程可无限延长。展示了视频生成模型在实时交互式内容生产场景的应用。

用视频生成模型搭了个能实时问答、排队出片的互动课堂,做 AI 教育内容和交互式叙事的可以看看这套工作流怎么串起来的。

点击打开原平台查看,能否访问取决于网络环境

Miro 用 Runway 做 Canvas26 开场视频并本地化 4 城

Miro 品牌团队用 Runway 为年度活动 Canvas26 生成开场视频全部底层镜头,并以场馆照片为参考图,针对 4 个城市分别本地化制作入场镜头。流程为先大量迭代静态图、再迭代视频,最后叠加 3D 动效和品牌元素;相比素材库可按需生成非标准画幅且不损失分辨率,Runway 前驻创意团队还提供专项培训帮团队建立模型选型能力。

品牌团队用 Runway 从静态图迭代到视频、再叠加 3D 动效的完整流程,做商业项目或品牌向 AI 视频的可以当模板拆解。

Google Antigravity 教程:generate_image 自动化图像生成

Google 团队「Elevating Antigravity Agent Skills」五部曲系列教程的第二部分,讲解如何在 agent skill 中使用 generate_image 工具,将结构化提示词合成与原生图像生成结合,使 agent 能产出符合开发者规范的图像。面向开发者,属于官方技术教程。

Google 官方五部曲教程的第二篇,讲怎么在 agent skill 里调 generate_image 工具,把结构化提示词和原生图像生成串起来。做工具链整合的可以照着搭一套自动化出图流程。

Magnific 分享多镜头动画分镜提示词

Magnific 官方账号分享一段可直接复制的多镜头动画序列提示词,示例包含镜头角度(低角度广角)、时长分段(0-3秒)、情绪节奏(忧郁喜剧感)和动作细节(看表、叹气、跺脚)等分镜要素。

官方直接甩出一段可复制的多镜头动画分镜 prompt,含镜头角度、时长、情绪节奏标注,做动画短片的可以直接抄来改。

作品与案例

Works

Seedance 2.5 初体验:民俗动作 AI 剧情短片

新片场 AIGC 分类下的 AI 剧情短片《最后一捧灶心土》,作者用 Seedance 2.5 制作,民俗动作题材,短片定位。

用 Seedance 2.5 做的民俗动作题材 AI 短片,做短剧和视觉的可以拉片看动作戏和民俗风格的画面一致性处理。

Magnific 原创系列《The Chronicles of Bone》第五集上线

Magnific 官方账号转发创作者 Kavanthekid 的消息:原创系列《The Chronicles of Bone》第一季第五集上线,全片由 AI 工具创作完成。作为官方出品的系列剧集,其角色一致性和视觉风格统一是值得拆解的重点。

Magnific 官方原创 AI 系列剧更新到第五集,做 AI 短剧和视觉开发的可以拉片看官方团队怎么处理系列化叙事和风格统一。

点击打开原平台查看,能否访问取决于网络环境

B站AI短片:下班回家你想回哪间出租屋

B站UP主「Nooduh」发布的AI短片,标题为「下班回家,你最想回到哪间出租屋呢?」,标注含AI生成内容,题材聚焦都市打工人下班回出租屋的日常场景,偏生活流与情绪向叙事,视觉上主打出租屋场景的氛围营造。

B站AI短片,题材是都市打工人下班回出租屋的日常,带点生活流和情绪向。做AI短剧的可以拉片看场景氛围和日常叙事怎么用AI做出来。

点击打开原平台查看

微信公众号 光影漫游AI 二维码
觉得日报有用的话,欢迎关注微信公众号,AI 影视创作的内容都在那里。
光影漫游AI
微信内长按二维码识别,或复制名称到微信搜索