← 全部日报

AIGC 信息日报

2026 年 9 月 4 日 周五

行业与平台

Industry

OpenAI 发布 GPT-6 Astra,多项基准近满分

Sam Altman 宣布 GPT-6 Astra 发布,定位为计算机使用、专业工作、科学、编码、网络安全等领域全球最佳模型。官方称因需达到该能力级别的安全与对齐标准而多花了时间,并公布 FrontierMath Tier 4 得分 98%、ARC-AGI 3 得分 99.9%、ExploitBench 得分 100%。

OpenAI 旗舰模型换代,推理和编码能力拉满,做 AI 短剧和工具链的可以关注后续 API 接入,看能不能把复杂调度和批量处理交给它。

点击打开原平台查看,能否访问取决于网络环境

Runway 发布 GWM Worlds 2 实时交互世界模型

Runway 发布 GWM Worlds 2,可在单一连续 720p 流中以 24fps 生成完整、交互式、实时视频模拟,并带 48kHz 音频,能随探索输入实时响应。官方称其为首个能泛化到任意动作(而非固定动作集或仅导航)的世界模型,动态动作对构建游戏和交互体验、训练智能体至关重要。同时推出 WorldPrompt,可将世界状态拆分为持久状态(重力、物理、光照)与随时间变化的状态(动作、手势、物体交互、语音、声音)。

Runway 把世界模型推到实时交互:720p 连续流、24fps、48kHz 音频,还能响应你的输入。做互动短剧、游戏化叙事的可以蹲 API,这可能是下一波交互影像的底子。

点击打开原平台查看,能否访问取决于网络环境

NVIDIA 129 亿美元收购 Hugging Face

NVIDIA 官方宣布以 129.303 亿美元收购 Hugging Face。Hugging Face 平台拥有超 1800 万开发者,托管超 300 万个模型、50 万个数据集和 100 万个应用,服务超 20 万家企业。对 AI 创作者而言,此次收购可能影响未来模型分发与托管生态,但当前创作工具链与工作流不受直接影响。

行业级大并购,AI 基建格局生变。做 AI 短剧和工具链的可以关注后续模型托管和 API 成本走向,短期对创作工作流无直接影响。

点击打开原文

Synthesia 推出 Assistant:一句话生成企业视频初稿

Synthesia 发布企业视频创作工具 Assistant:支持上传文档、URL 或纯文本描述需求,自动生成带品牌模板的初稿,生成后可通过对话持续修改而无需从头开始。面向企业级视频制作场景,主打从需求到成片的效率提升。

做企业宣传片、产品介绍片的团队可以关注,从文档/链接到带品牌模板的初稿只要几分钟,后续还能对话修改不用重来,适合批量出片场景。

点击打开原平台查看,能否访问取决于网络环境

Google DeepMind 发布 WeatherNext 3 天气模型

Google DeepMind 与 Google Research 联合发布 WeatherNext 3,官方称其为迄今最先进、最准确的全球天气 AI 模型。该模型利用实时卫星数据,生成逐小时高分辨率预报、精确降水预报及清洁能源变量。

当天有 5 家独立信源在报同一件事,属于行业动向本身。对具体创作流程没有直接用处,但这个量级的消息值得知道。

点击打开原平台查看,能否访问取决于网络环境

OpenAI 疑似筹备图像模型升级 ImageGen 2.5

TestingCatalog 发现 OpenAI 正在准备图像模型的下一次升级,ChatGPT 内置隐藏公告弹窗显示图像创作迎来重大升级,文案为更高质量结果、更快生成和更智能的创意工具。此前 OpenAI 已被发现在 Image Arena 上测试新图像模型,推测可能为 GPT-Image-2.5。

OpenAI 图像模型要升级了,ChatGPT 弹窗文案写着更高质量、更快生成、更智能的创意工具。做视觉和短剧分镜的可以蹲一下,等正式发布后实测风格一致性和出图速度。

点击打开原文,能否访问取决于网络环境

Krea 创意工作智能体 Beta 今日开启

Krea AI 官方宣布已构建面向创意工作的智能体,Beta 于发布当天开启,用户可通过评论或转发获取早期访问资格。官方称其为「世界最好的创意工作智能体」,但未透露具体功能细节、模型能力或接入方式。

做视觉和整合的可以蹲一下,Krea 把智能体押在创意工作流上,评论转发能拿早期访问资格,想试的现在就能去抢。

点击打开原平台查看,能否访问取决于网络环境

ElevenLabs 与 Genesys 合作部署语音 Agent

ElevenLabs 宣布与 Genesys 合作,帮助企业部署自然语音 Agent。可将 ElevenAgents 接入 Genesys Cloud Agentic Virtual Agents 的客户旅程中,协调多个 Agent 协同工作,或为 Genesys Agent 提供 ElevenLabs 的表达型语音。面向企业客服场景,对 AI 配音从业者而言是语音能力进入企业级应用的一个落地信号。

做 AI 配音和虚拟角色对话的可以留意,这是把 ElevenLabs 语音接进企业客服流程的官方合作,后续 API 调用和场景案例值得跟。

点击打开原文,能否访问取决于网络环境

工具与能力

Tools

Midjourney v8.2 编辑模型上线,lightbox 支持自然语言改图

Midjourney 向 alpha 站推送大型更新:v8.2 编辑模型上线 lightbox 内置编辑器,支持自然语言指令编辑、最多附 4 张参考图,并集中查看会话编辑记录;同时测试 Change Style 风格探索功能,修复大量 bug,Niji 7 的 inpainting 已正常工作。下一步将设置默认参数并用提示词预览 sref。

做视觉和美术的这波直接受益:v8.2 编辑模型进 lightbox,能用自然语言指令改图、一次带 4 张参考图,改版式调风格不用再反复抽卡,值得上手实测一轮。

点击打开原文

Google Flow 打通图像编辑到视频全流程

Google Flow 官方发布工作流拆解:Nano Banana 2 负责快速概念生成与风格测试,Nano Banana Pro 负责精确场景编辑、多角度拍摄和排版,Omni Flash 将图像作为素材或框架生成视频。官方展示了从静态图到动态视频的完整流程,覆盖概念、编辑、视频三个环节。

官方拆解了从概念生成到视频成片的完整工作流,做短剧和视觉的可以直接照这套流程跑一遍,看角色一致性和多角度拍摄稳不稳。

点击打开原平台查看,能否访问取决于网络环境

Higgsfield Genjutsu 实现整帧动作控制

Higgsfield AI 官方宣布 Genjutsu 功能,定位为针对整个画面的动作控制,可一比一重复表演、摄影和剪辑,并应用到用户选择的任意世界中。该功能面向视频生成场景,强调对镜头语言和表演的精确复刻能力。

做 AI 短剧和编导的可以重点看:能把真人表演、运镜和剪辑一比一搬到任意世界,等于给镜头语言控制开了个新口子,值得实测。

点击打开原平台查看,能否访问取决于网络环境

OpenRouter 上线视频模型横向评测

OpenRouter 推出视频模型横向评测功能,支持在多种挑战任务下并排对比不同视频模型。评测显示 Seedance 2.5 在物理模拟和指令遵循方面表现突出,新发布的 MiniMax H3 Max 则在生成速度和成本上树立新标杆。

选视频模型前先来这拉个对比,Seedance 2.5 物理和指令遵循强,MiniMax H3 Max 主打速度和成本,做短剧的挑模型能省不少试错时间。

点击打开原平台查看,能否访问取决于网络环境

Gemini 语音功能上线,可对话操作 Gmail、Keep 和 Docs

Sundar Pichai 宣布 Gemini 新语音功能开始推送,面向 Google AI 订阅者开放。用户可用对话方式搜索 Gmail 收件箱、在 Keep 中整理想法和任务、创建新 Docs,其中 Docs Live 功能被特别提及。对 AI 影视创作者来说,这是办公协作层面的效率工具,不直接涉及视频生成或画面创作,主要影响项目管理和文档整理环节。

Google 把语音助手接进办公套件,对创作团队的价值在制片和统筹环节——语音整理任务、建文档,做短剧的可以当团队协作工具试试,跟出片本身关系不大。

点击打开原平台查看,能否访问取决于网络环境

Anthropic 探索 Claude Code 新增 Function Hooks 功能

Anthropic 团队正在探索为 Claude Code 增加 Function Hooks 功能,用于扩展和自定义 Claude Code 的行为,并发布了演示视频展示其用途。该功能尚未正式发布,团队在 GitHub issue 上公开征集反馈。

Claude Code 的扩展机制在探索阶段,还没发布,做 AI 编程工作流整合的可以关注下 GitHub issue 里的反馈方向,对创作流水线影响有限。

点击打开原平台查看,能否访问取决于网络环境

方法与经验

Methods

Runway 公布 GWM Worlds 2 研究:720p 实时交互模拟

Runway 公布通用世界模型 GWM Worlds 2 研究进展,可生成 720p、24 fps 连续视频并配 48000 Hz 音频的交互式实时模拟。用户可定义环境、主体、视觉风格、物理规则和氛围,用文本动作和连续镜头运动控制世界,会话没有预设长度,不遵循固定片段或脚本。

Runway 官方放出 GWM Worlds 2 研究,主打连续 720p 视频加音频的实时交互模拟,世界不按固定脚本走。做 AI 编导和视觉的可以研究下这套「文本动作+连续镜头」控制逻辑,看能不能用到自己的叙事工作流里。

点击打开原平台查看,能否访问取决于网络环境

Seedance 2.0/2.5 提示词内嵌音频写法公开

官方公布 Seedance 2.0 与 2.5 的提示词内嵌音频语法:圆括号 () 表示音乐,尖括号 <> 表示音效,花括号 {} 表示对白;任何口播台词前需注明语言;时长与宽高比不在提示词内设置,需在页面配置。

做 AI 短剧和视频的可以直接抄:把音乐、音效、对白写进提示词,Seedance 2.0 和 2.5 都认这套语法,后期配音对轨能省不少事。

Video Delta Net 开源:混合注意力实现近无损实时文生视频

Video Delta Net(VDN)发布,采用混合注意力实现近无损质量的实时文本生成视频,称开源视频生成速度已超过播放速度。VDN 将 MiniMax-H3 加速 75-90 倍,在 8× NVIDIA B200 GPU 上 11 秒生成 14 秒 768p 视频,并开源 checkpoint、训练/推理代码和技术博客。

开源视频生成速度超过播放速度,把 MiniMax-H3 加速 75-90 倍,做 AI 短剧和批量出片的可以关注这套加速工作流,能显著降低单条视频的生成等待成本。

点击打开原平台查看,能否访问取决于网络环境

AI视频人物一致性差?三种角色参考图方案

针对AI视频人物一致性差、人脸塑料感问题,提出三种角色参考图方案。指出传统角色卡(白底三视图+近景上半身面部照)存在三视图正面面部信息不足等问题,需改用更有效的参考图组合来提升角色一致性。

做AI短剧和视觉的常被角色一致性卡住,这篇直接给三种角色参考图做法,可以照着搭一套自己的角色卡工作流。

点击打开原文,能否访问取决于网络环境

Ethan Mollick 用 GPT-6 五天无干预构建个人知识库

Ethan Mollick 让 GPT-6 阅读其数万封邮件、writings 和日程,自主下载软件、制定策略,在五天不间断工作中无需干预地构建了数 GB 的个人 wiki,涵盖研究、联系人、想法和任务。现在该 AI 每天两次交叉核对新邮件并发送摘要简报。他提醒授权访问电脑存在风险需谨慎,试用期内 token 未收费,无法告知完整成本但可能相当可观,日常简报 token 消耗不大。

AI 技术整合者可以看看:让 GPT-6 自主下载软件、制定策略、连续五天无干预跑完一个数 GB 的个人知识库项目,这套「放权式」Agent 工作流对搭建自动化创作工作流有直接参考价值。

点击打开原文,能否访问取决于网络环境

Higgsfield 演示 GPT-6 Astra 用代码生成 3D 场景

Higgsfield AI 演示:用 GPT-6 Astra 以 vibe-coding 方式将椭圆形办公室建模为 3D。流程为描述布景设计 → GPT-6 Astra 生成场景代码 → Higgsfield 在 Blender 中构建位置模型并用 Cycles 渲染,整个流程在 Higgsfield 超级计算机上全流程运行。

从文字描述到 3D 场景代码再到 Blender 渲染的全流程演示,做 AI 视觉和场景设计的可以看看这套工作流怎么串起来的。

点击打开原平台查看,能否访问取决于网络环境

Astra 3D 建模实测:从 Blender 场景到 UE5 可漫步体验

Thomas Ricouard(@Dimillian)分享 Astra 在 3D 建模方面的能力,并给出一个教程,展示如何为发布博客文章构建演示房屋,工作流从 Blender 场景到 Unreal Engine 5 可漫步体验。

Astra 的 3D 建模能力演示,作者分享了从 Blender 场景到 UE5 可漫步体验的完整工作流,做 AI 视觉和 3D 场景的可以看看这套流程怎么串。

点击打开原平台查看,能否访问取决于网络环境

Playco 用 GPT-6 Astra 做游戏原型,手动修复减半

OpenAI 官方博客案例:游戏公司 Playco 用 GPT-6 Astra 从同一灰盒基础原型扩展出三个主题游戏原型,相比前代模型手动修复工作量减少 50%。属于 AI 辅助游戏原型开发的效率案例,核心价值在批量迭代与减少人工返工。

游戏公司用 GPT-6 Astra 从灰盒原型批量出三个主题版本,手动修复减半。做互动叙事或游戏化短剧的团队可以参考这套批量迭代思路,但本质是游戏开发案例,跟拍片关系不大。

点击打开原平台查看,能否访问取决于网络环境

GPT-Image-2.5 实测:无参考复刻爱因斯坦笔迹

创作者实测 GPT-Image-2.5 的图像生成能力:仅凭文字 prompt,未提供任何参考图,成功生成爱因斯坦风格的手写论文照片。Prompt 关键点在于指定铅笔书写、8.5x11 横线纸、字迹要有爱因斯坦式变化、右上角带轻微咖啡渍,并附 AI 输出与 Reddit 真实照片的对比。

视觉师可以看看这个 prompt 的写法——要求手写体有变化、带咖啡渍,GPT-Image-2.5 在无参考图的情况下做到了,做道具字、旧纸张这类细节可以套用。

点击打开原文,能否访问取决于网络环境

用户实测 Fable 5.1 能写狂草书法

用户 @yuwen_lu_ 实测分享:Fable 5.1 模型能自行研究并写出狂草书法,并附 26 秒演示视频展示写字过程。个人体验分享。

个人实测感慨,说 Fable 5.1 能自己琢磨出狂草笔法,对书法字效、标题字设计感兴趣的视觉师可以点开看个效果,但没给工作流细节。

点击打开原平台查看,能否访问取决于网络环境

作品与案例

Works

Higgsfield 演示 Seedance 2.5 一镜穿越七房间

Higgsfield AI 官方发布演示:一个镜头无剪辑穿越七个房间。工作流为 GPT-6 Astra 负责空间映射与调度(镜头从未离开视口),Higgsfield Seedance 2.5 负责渲染全程。展示多房间连续空间下的镜头一致性与长镜头生成能力。

一镜到底穿七个房间,镜头调度和空间一致性是看点,做长镜头和空间叙事的编导可以拉片看 GPT-6 Astra 怎么把空间映射和运镜串起来。

点击打开原平台查看,能否访问取决于网络环境

新加坡首部AI混合剧情片《The Crooks》引热议

新加坡首部AI混合剧情片《The Crooks》引发讨论。创作者观点:人物情绪、动作、微表情需绝对真实,采用实拍;光影、场景、VFX、氛围感塑造用AI完成。核心思路是用实拍托住真实感,用AI放大表达力。

实拍托真实感、AI放大表达力的混合制作思路,做剧情片和短剧的可以拉片看实拍与AI场景怎么衔接。

点击打开原平台查看,能否访问取决于网络环境

Penumbra 第四集上线,InVideo Agent Two 生成

AI 短剧系列《Penumbra》第四集上线,由 InVideo Agent Two 生成。作者强调即使部分镜头不完美,故事始终优先,展示了该工具在长叙事连贯性上的表现。

AI 短剧系列新一集,用 InVideo Agent Two 生成,作者强调叙事优先于单镜头完美度,做短剧的可以拉片看整体叙事连贯性怎么处理。

点击打开原平台查看,能否访问取决于网络环境

GPT-6 Astra 在 Blender 重现旧金山美术宫

Sharif Shameem 用 GPT-6 Astra 在 Blender 中重现旧金山美术宫,该建筑为 1914 年世界博览会而建。个人创作者展示 AI 模型在 3D 建模软件中还原真实历史建筑的能力,偏建筑可视化与场景重建方向。

个人创作者用 GPT-6 Astra 在 Blender 里重建旧金山美术宫,偏建筑可视化方向,做 AI 3D 场景和视觉开发的可以看看模型对复杂建筑结构的还原能力。

点击打开原平台查看,能否访问取决于网络环境

《跳个舞(58)》发布

B 站作者「鱼子酱不睡懒觉」发布的 AI 短片《跳个舞(58)》,动作类题材,配乐为《小城夏天》。个人创作者作品,看点集中在 AI 动作生成的自然度与节奏感。

个人创作者的动作类 AI 短片,视觉师可当动作流畅度参考。

点击打开原平台查看

微信公众号 光影漫游AI 二维码
觉得日报有用的话,欢迎关注微信公众号,AI 影视创作的内容都在那里。
光影漫游AI
微信内长按二维码识别,或复制名称到微信搜索