← 全部日报

AIGC 信息日报

2026 年 9 月 30 日 周三

行业与平台

Industry

OpenAI 升级 GPT-6.1 Sol 代理式编码

OpenAI 开发者账号宣布 GPT-6.1 Sol 更新(该产品 9 月 23 日已发布),升级了代理式编码和计算机使用能力,性能接近 Astra,缓存输入按标准输入定价的 95% 折扣计费,官方定位是复杂重构、深度代码库调查和跨应用长期运行的 Agent 场景。对做自动化创作流程的团队来说,这类长时运行的 Agent 能力可用于批量素材处理、跨工具调度等环节,但本条未涉及图像/视频/音频生成能力。

OpenAI 的 GPT-6.1 Sol 更新(该产品 9 月 23 日已发布),主打代理式编码和计算机操作,缓存输入按标准价 95% 折扣计费,做自动化工作流和 Agent 的可以接 API 测一轮。

点击打开原平台查看,能否访问取决于网络环境

OpenAI 发布 dots:跨项目持续推进的主动助手

OpenAI 官方博客发布 dots,定位为主动型助手(proactive assistant),可在复杂项目和日常任务之间持续工作,官方强调用户仍能保持对进程的掌控。原文未给出具体模型、参数或接入方式,仅说明其跨任务持续推进的能力定位。对需要同时盯多个长周期项目的制片和 AIGC 整合者来说,这类主动助手可能改变任务跟进方式,但具体能否接入现有创作流程还需看实际产品形态。

OpenAI 官方上线 dots,定位是能跨复杂项目持续推进、同时让你保持掌控的主动型助手。做多线并行项目的制片和整合者可以点开看它怎么接管长周期任务。

点击打开原平台查看,能否访问取决于网络环境

Simon Willison 实时博客 OpenAI DevDay 2026 主题演讲

Simon Willison 在旧金山 Fort Mason 现场实时博客 OpenAI DevDay 2026 主题演讲。Altman 上台称这是「最好的一届 DevDay」,先回顾了 Codex on Linux 和 Codex 手机版等已上线功能,随后发布一款定位「与 AI 协作的全新方式」的产品:用户可自定义名字,形象是一个 blob 状头像,演示视频包含大量语音交互,头像「由 Astra 驱动」,并展示了一个迁移 API 的用例。Willison 本人用 Claude Code for web 搭了给实时博客加照片的系统。

Simon Willison 在 Fort Mason 现场逐条记录 DevDay 主题演讲,Altman 上台发布了一款可自定义名字、带 blob 头像的个人 Agent,演示里大量语音交互。做 Agent 工具链和 AI 工作流的可以顺着这份现场记录看 OpenAI 下一步往哪走。

Runway 成为 OpenAI Marketplace 首发合作伙伴

Runway 官方宣布以首发合作伙伴身份加入 OpenAI Marketplace,即日起用户可在该平台访问图像、视频、音频和编辑模型,并可将部分 OpenAI 承诺额度用于在 Runway 上的购买。对同时使用 OpenAI 企业额度与 Runway 的团队来说,采购路径多了一条,具体可用模型清单和额度抵扣比例需看官方链接。

Runway 进了 OpenAI Marketplace,OpenAI 的承诺额度能直接拿来买 Runway 的图像、视频、音频和剪辑模型。已经在用 OpenAI 企业额度、又同时跑 Runway 的团队,可以查一下这笔钱能不能省下来。

点击打开原文,能否访问取决于网络环境

工具与能力

Tools

Eleven v4 Turbo 接入 ElevenAgents,延迟约 100 毫秒

ElevenLabs 宣布 Eleven v4 Turbo 已在 ElevenAgents 中上线,把 Eleven v4 的 #1 评级音质带入实时对话场景,中位推理延迟约 100 毫秒,官方称可支撑更多行业的个性化、有同理心的客户体验。对做实时配音、虚拟角色对白、互动语音的后期和整合团队来说,这是把高质量 TTS 从离线生成推进到实时对话流程的一次更新,可接 API 实测延迟与情绪表现。

Eleven v4 的高质量音色现在能进实时对话了,中位延迟约 100 毫秒。做 AI 配音、虚拟角色实时对白的后期和整合团队,可以接 API 测一轮延迟和情绪表现。

点击打开原平台查看,能否访问取决于网络环境

ChatGPT 上线 Space 团队协作空间与交互式文档

ChatGPT 官方推出 Space,定位团队与 AI 协作的新空间,内含新型交互式文档 pages,支持图表、图片、清单和仪表盘,ChatGPT 可根据任务或对话上下文自动生成页面。团队可直接编辑页面,或 @ChatGPT、Codex 及自定义 dot 处理待办事项,并从已连接的数据源同步更新页面。今日起向 Pro、Business、Enterprise 套餐推送,网页端和桌面端可创建编辑,移动端仅查看,协作幻灯片等格式即将推出。

ChatGPT 给团队开了个协作空间,能自动生成带图表、清单、仪表盘的交互式文档,还能 @Codex 跟进待办。做制片统筹、项目排期的可以拿它管一个组试试。

点击打开原平台查看,能否访问取决于网络环境

OpenAI 推出 Ultrafast 高速层级,Codex 提速 8 倍

OpenAI 发布高级速度层级 Ultrafast,在 Codex 中提供最高 8 倍更快的 token 生成速度(每秒 300 个 token),API 中最高 6 倍。属于付费速度档位,面向需要高吞吐的调用场景。对做批量生成、自动化脚本和 Agent 流程的团队,提速主要影响长任务等待时间和并发成本。

Codex 里每秒 300 token、API 端 6 倍提速,做批量脚本和自动化流程的可以接 API 测一下实际吞吐。

点击打开原平台查看,能否访问取决于网络环境

ChatGPT 订阅可在 16 家合作产品中直接使用

OpenAI 的 Tibo(@thsottiaux)宣布,ChatGPT 订阅现在可以直接在超过 16 家合作产品中使用,官方说法是「没有繁琐规则,直接用掉全部包含的使用额度」,点名了 Devin、OpenCode、Notion 等产品,用 ChatGPT 账号登录即可。对做创作自动化流程的团队来说,如果常用工具在这份名单里,等于一份订阅能覆盖多个环节,省掉单独采购和额度管理的麻烦。

OpenAI 把 ChatGPT 订阅额度打通到 Devin、OpenCode、Notion 等 16 家合作产品,用 ChatGPT 账号登录即可直接消耗订阅额度。做自动化流程和工具链的可以看看自己常用的那几个在不在名单里。

Notion 称 ChatGPT 订阅可覆盖其 AI 使用

Notion 官方宣布:已订阅 ChatGPT Plus 或 Pro 的用户,该订阅现在覆盖在 Notion 内的 AI 使用。操作方式是连接自己的套餐、选择 GPT 模型后即可使用。对用 Notion 写剧本大纲、分镜表、项目文档的编导和制片来说,等于把已有的 ChatGPT 订阅额度延伸到文档工具里,不必再单独购买 Notion 的 AI 席位。

有 ChatGPT Plus/Pro 的团队,Notion 里的 AI 用量现在走同一份订阅,不用再单独买 Notion AI 席位。做剧本大纲、分镜表、项目文档的可以连上试试,省一笔工具钱。

点击打开原平台查看,能否访问取决于网络环境

方法与经验

Methods

Every 实测 OpenAI DevDay 2026 二十多项发布

Every 评测 OpenAI DevDay 2026 发布的 20 多项产品和功能。作者实测后认为 Dots 持久智能体已改变其使用习惯但 bug 较多,Space 办公套件体验较好;Decisions API 在部分测试中以 76/78 对 73/78 的准确率和 230 毫秒对 500 毫秒的响应速度优于 Jev,但另一些测试落后,定价未公布。文中还提到一档每月 500 美元的套餐,含 OpenAI 最高用量额度和 ChatGPT Work 与 Codex 中 Astra Ultrafast 的独家访问。

第三方实测视角,Dots 持久智能体、Space 办公套件、Decisions API 都有上手反馈和跑分对比,做 AI 工作流和 Agent 的可以看这份避坑清单。

点击打开原文

宝玉称 Opus 5.5 独立完成视频剪辑

宝玉(@dotey)分享了一段由 Opus 5.5 自主完成剪辑的视频,并转述作者在评论里公开的 7 步工作流:撰写脚本、从 YouTube 和档案馆搜集知识共享许可素材、剪辑与画面裁剪、画质超分与上色、与配音及字幕标注组合、制作背景配乐、审视成片并迭代优化。对后期和短剧团队来说,这条的价值在于它把「AI 独立完成一条片子的剪辑全流程」拆成了可复用的步骤清单,可以逐环节对照自己现有的工作流,判断哪些能交给模型跑。

从写脚本、找 CC 素材、剪辑裁切、超分上色到配音字幕配乐,7 步全交给 Opus 5.5 跑完。做后期和短剧流水线的可以照着这套流程试一遍,看哪些环节能省人手。

点击打开原平台查看,能否访问取决于网络环境

作者用 MiniMax M3.1 复刻沙丘机械沙虫 3D 网页

作者用 MiniMax 昨天上线的 M3.1-Flash-Preview,把 X 上刷屏的《沙丘》沙虫变机器人概念视频复刻成一个单文件 HTML 3D 网页,Three.js 走 CDN、零构建,浏览器双击即跑。成品含 6 个机位切换、X 射线内部结构透视、阿拉基斯地形图、头部截面与纵剖面,中段 24 节蠕动驱动拆成收缩/锚定/伸展/释放四拍。作者称前后 7 轮对话、4 个多小时,其中一轮模型自主跑了 55 分 38 秒。模型底子是 M3 编程线,100 万上下文,官方文档写明支持图片和视频输入;出字速度 282 token/秒,思考档默认锁在 max 且关不掉,共 low/med/high/xhigh/max 五档。目前为预览版,仅 MiniMax Code 和 Token Plan 可用,未开放按量 API。

一个 HTML 文件搓出 1312 米机械沙虫,6 机位、X 射线剖面、24 节蠕动全拆开,作者把提示词和参考图都开源了。做概念设计和分镜预演的可以拿这套流程试一遍。

点击打开原平台查看,能否访问取决于网络环境

作者建议用生成式AI视频时购买 DaVinci Resolve Studio

Roope Rainisto 分享的生成式 AI 视频工作建议:投资购买一次性买断的 DaVinci Resolve Studio,因为 Studio 版拥有完整 API 访问权限(免费 21.0.n 版本虽可搭配 MCP,但 API 受限)。接上 MCP 后可用 ChatGPT App(含其图像生成能力)下达自然语言指令,例如「把背景里那个角色去掉」,ChatGPT 会调用 Resolve 和 Fusion 自动执行。作者提到执行需要一点时间,但基本是免费运行。

后期和剪辑师可以试的路子:买断版 Resolve Studio 有完整 API,配合 MCP 让 ChatGPT 直接跑 Resolve 和 Fusion,一句「把背景里那个人去掉」就动手。

点击打开原文,能否访问取决于网络环境

Claude Opus 5.5 配 Higgsfield 做动态图形解说

创作者 @maxescu 分享了一套双模型分工的 prompt 模板:让 Claude Opus 5.5 Max 负责全部动效与动画,Higgsfield 只生成视频里的静帧图像,目标是产出一支 60 秒的印刷机历史动态图形解说片。风格指定为报纸剪贴拼贴——分层纸片、撕边、半调纹理、柔和阴影加粗体编辑排版。规则里明确要求事实与日期准确、Higgsfield 生成的图内不得出现文字(所有文字由 Claude 以动态排版补上)、全片视觉保持一致,并让结尾回到开场帧以实现无缝循环、禁止硬切收尾。

一条可直接抄的 prompt 分工模板:Higgsfield 只出静帧、动效和排版全交给 Claude,还规定了循环收尾和禁用图内文字。做动态图形和科普解说的可以存下来改改就用。

点击打开原平台查看,能否访问取决于网络环境

Kling 4.0 Flash 与 Seedance 2.5 同条件实测对比

作者用相同提示词、相同参考图像、720p/20 秒的条件对比 Kling 4.0 Flash 与 Seedance 2.5,并给出每秒成本:Kling 4.0 Flash 约 12.5 日元(估算价),Seedance 2.5 约 51 日元(10 个服务平均),单条 20 秒约 250 日元对约 1000 日元,成本差约 4 倍,附两段对比视频。

同一提示词、同一参考图、720p/20 秒的横向对比,还算了每秒成本:Kling 4.0 Flash 约 12.5 日元、Seedance 2.5 约 51 日元,单条 20 秒差约 4 倍。做短剧要控成本的,先看这条再决定主力模型。

点击打开原平台查看,能否访问取决于网络环境

Elevenlabs 与 Gemini TTS 最新模型对比

日本创作者 @nakazakifam 对比 ElevenLabs Eleven v4 与 Gemini 3.8 Flash TTS 两款最新语音模型,结论是两者都自然,Eleven v4 这次日语能力大幅加强。视频为 AI 头像 YouTube 风格解说,工具链公开:图像 GPT-Image-2.5、视频 LTX 2.3、音效 Epidemic Sound、BGM 与台本编辑 Opus 5.5、环境 Claude Code / Codex CLI / Colab CLI。

日语 TTS 选型实测:Eleven v4 日语明显加强,跟 Gemini 3.8 Flash TTS 摆一起比自然度。做配音和 AI 口播的可以听一遍再定用哪个。

点击打开原平台查看,能否访问取决于网络环境

作者试听后称中文配音 Gemini 3.8 Flash 胜过 Eleven v4

创作者 @nicekate8888 应观众提问,对比测试 Eleven v4 与 Gemini 3.8 Flash TTS 的中文配音效果,试了 ElevenLabs 的内置音色和 Voice Design 两种方式。就试听感受而言,作者认为中文表现 Gemini 3.8 Flash TTS 更胜一筹;同时提到 Eleven v4 生成的音频频繁出现重复朗读,原因不明,并向其他用户询问是否遇到同样问题。

做中文配音的可以拿这条当选型参考:作者实测 ElevenLabs 内置音色和 Voice Design,认为 Gemini 3.8 Flash TTS 中文更自然,Eleven v4 还频繁重复朗读。自己跑一遍对比再定。

点击打开原平台查看,能否访问取决于网络环境

调色、光影与肤质修图提示词指南

Luma AI 官方博客发布《AI Photo Editing Prompts for Color, Light, and Skin》,主题是图像编辑中调色、光影和皮肤质感三类提示词的写法。原文仅给出标题,未展开具体提示词内容与示例图。做 AI 人像修图和视觉开发的可以点开看官方给的提示词结构。

Luma 官方整理的修图提示词合集,覆盖调色、打光和皮肤质感三个方向,做 AI 人像和海报的视觉师可以存下来当模板改。

点击打开原文

FLORA 帧配 Remotion 动画,Opus 5.5 串起工作流

FLORA 官方账号转发 @node_pilled 的一条工作流演示:用 FLORA 生成画面帧,交给 Remotion 做程序化动画,中间由 Opus 5.5 把两者串起来。原文只有这一句说明加一个链接,没有参数、时长或成片细节。对做动态图形、片头包装和批量模板的后期来说,这个组合值得自己搭一遍看衔接顺不顺。

FLORA 出帧、Remotion 做程序化动画、Opus 5.5 在中间接线,做动态图形和批量片头的可以顺着这条思路试一遍。

点击打开原平台查看,能否访问取决于网络环境

作品与案例

Works

可灵 Kling 4.0 满血版内测短片《SPARE》

创作者汗青 HQ 用可灵 Kling 4.0 满血版全能参考生成的短片《SPARE》,为可灵 AI 内测邀约作品。作者对比称满血版比 Flash 强不少:原生 30 秒直出、画面与声音更清晰、口型匹配更精准、21:9 电影画幅。可灵 Kling 4.0 将于 10 月上线。

可灵 4.0 满血版内测成片,原生 30 秒直出、21:9 电影画幅、口型匹配更准,做 AI 短片的可以拉片看它长镜头和音画同步的处理。

点击打开原平台查看,能否访问取决于网络环境

B站UP主称AI短剧《全7季加长版》演技最佳

B站UP主「帧燃忆漫馆」发布的AI短剧《全7季加长版》,以多季合集形式呈现,标题强调角色演技表现。抓取正文仅含相关推荐视频链接与时间戳,无剧情、工具或制作细节。做AI短剧的可以拉片看它的角色表演和系列化叙事处理。

B站UP主「帧燃忆漫馆」的AI短剧合集,标题主打演技表现,做AI短剧的可以拉片看角色表演和长系列叙事怎么处理。

点击打开原平台查看

B站AI新番PV:大模型拟人化「败犬」恋爱剧

B 站 UP 主发布的 AI 动画新番正式 PV,4K 画质,把 DeepSeek、Gemini、Claude、GPT 等大模型拟人化成「败犬」角色,台词围绕「不再是 SOTA」展开,走二次元恋爱剧路线。做 AI 短剧和动画向内容的可以看它怎么把行业梗转成角色对白和剧情。

把 DeepSeek、Gemini、Claude、GPT 拟人成「败犬」角色的 AI 动画 PV,做 AI 短剧和二次元向内容的可以拉片看角色设定和台词怎么把模型梗写成戏。

点击打开原平台查看

微信公众号 光影漫游AI 二维码
觉得日报有用的话,欢迎关注微信公众号,AI 影视创作的内容都在那里。
光影漫游AI
微信内长按二维码识别,或复制名称到微信搜索