← 全部日报

AIGC 信息日报

2026 年 10 月 8 日 周四

行业与平台

Industry

OpenAI 公开 GPT-6 Sol 与 GPT-6 Luna 系统卡

OpenAI 在 2026 年 10 月更新中官方介绍 GPT-6 Sol 与 GPT-6 Luna 两款模型(该产品 9 月 23 日已发布),同步公开部署安全与系统卡。两者在生物与化学领域被评定为 High capability,GPT-6 Sol 的 Critical capability 评测结果未越过指示性阈值。目前公开信息集中在安全评估层面,未涉及生成能力、上下文长度、价格或 API 开放时间等参数。

OpenAI 一次放出 Sol 和 Luna 两个 GPT-6 型号(该产品 9 月 23 日已发布),此次随附部署安全与系统卡,生物化学领域被评 High capability。做 Agent 和自动化流程的可以盯一下后续 API 开放节奏。

点击打开原文

Vidu Q4 Preview 上线,0.014 美元每秒

Vidu AI 官方发布下一代旗舰 AI 视频模型 Vidu Q4 Preview,现已上线,官方描述其具备富有表现力的表演、电影般的摄影语言和高冲击力视觉特效,定价低至 0.014 美元/秒。官方同步放出新用户邀请码 VIDUQ4PV1,关注、转发并回复该帖可在 72 小时内通过私信领取 200 Credits。

Vidu 下一代旗舰视频模型上线,官方主打电影感镜头语言和高冲击力特效,价格压到每秒 0.014 美元。做短剧和批量出片的可以拿新用户邀请码先跑几条,看运镜和特效稳不稳。

点击打开原平台查看,能否访问取决于网络环境

微软发布 MAI-Code-1.1 Flash 与本地 Agent 方案

微软在 Windows 上发布一批更新:MAI-Code-1.1 Flash 是 137B 参数、256K 上下文的编程模型,已针对本地 PC 运行优化;GitHub Copilot 可把任务交给本地模型处理以降低成本;Hybrid Intelligence 让 Copilot 直接在 PC 上执行操作、敏感工作留在本机;Code in Copilot 支持在桌面端构建软件、不消耗云端 token;Windows 与 Agent 365 打通,提供 MXC 本地沙箱供 Agent 执行;新设备 Surface Laptop Ultra 搭载 NVIDIA RTX Spark。

微软把 137B 编程模型塞进本地 PC,Copilot 可把活交给本地模型跑、不烧云端 token。做自动化流程的可以留意本地跑 Agent 这条路,纯拍片的这周先路过。

点击打开原文,能否访问取决于网络环境

Fish Audio 推出 Drama 3 预览版

Fish Audio 发布语音模型 Drama 3 预览版,API 调用名 drama-3-preview。官方称其不只是念台词,而是能按自然语言指令直接调度表演——语气、情绪、节奏、角色都可指定,并支持在一句台词中途切换情绪,无需重录。对配音、AI 短剧和虚拟角色对话团队来说,情绪中途切换这一点直接对应多情绪台词的返工痛点,可接 API 实测出片稳定性。

配音和短剧团队可以试的点:用大白话直接指挥语气、情绪、节奏和角色,还能在一句话中间换情绪不用重录,API 里挂 drama-3-preview 就能跑。

点击打开原平台查看,能否访问取决于网络环境

Anthropic 发布 Claude Haiku 5.5,10 万 token 以下降价

Anthropic 发布 Claude Haiku 5.5,主打 10 万 token 以下任务的低价:输入每百万 token $0.10、输出 $0.50、缓存读取 $0.01;超过 100k 后输入 $0.50、输出 $2.50。对比 Haiku 4.5 的输入 $1.00、输出 $5.00,短任务成本降幅明显。官方称 10 万 token 以下任务约占上一代 Haiku 请求量的九成。

10 万 token 以下输入每百万 $0.10、输出 $0.50,比 Haiku 4.5 便宜十倍,官方说这类请求占上一代九成。批量跑剧本拆解、字幕翻译、素材打标的团队可以换模型算一遍成本。

点击打开原文,能否访问取决于网络环境

Krea 推出 Photoshop 插件,多模型直接进 PS

Krea 发布 Photoshop 插件,把 Krea 平台上的模型全部接入 PS,官方点名 Nano Banana、Krea 2、GPT IMG 2.5 等。用户在 Photoshop 内即可调用这些模型出图,无需切换到 Krea 网页端。对做视觉开发和后期修图的创作者来说,出图与修图可以在同一个软件里完成,减少素材来回导出的环节。

Krea 把自家全部模型塞进 Photoshop 面板,Nano Banana、Krea 2、GPT IMG 2.5 都能在 PS 里直接调,做视觉和修图的可以装上试一周,省掉来回导图的功夫。

点击打开原平台查看,能否访问取决于网络环境

Google 开放 SynthID 检测门户,可查 OpenAI 等家水印

Google 把 SynthID 水印检测能力做成公开门户,任何人可上传图片、视频、音频文件查验是否带 SynthID 水印,覆盖 Google 自家及 OpenAI、英伟达、Kakao 等合作方生成的内容,苹果即将加入。官方称累计已为 1800 亿张图片和视频、超 24 万年时长的音频打上水印,日均处理 100 万次验证请求。该门户与 Search、Gemini App、Chrome 中已有的验证功能并列。

SynthID 检测门户对外开放,任何人上传图片/视频/音频就能查是不是 AI 生成,还接了 OpenAI、英伟达、Kakao 的水印,苹果在路上。做 AI 短剧和商单交付的,可以拿它当交付前的自查工具跑一遍。

点击打开原文,能否访问取决于网络环境

Google DeepMind 推出 SynthID Detector 水印检测工具

Google DeepMind 推出 SynthID Detector,可快速识别视频、音频和图像中的 SynthID 水印,即使经过添加滤镜等编辑仍可检测。用户也可使用 Chrome、Google 搜索和 Gemini 应用中已有的 AI 内容识别功能。对做 AI 影像交付的团队来说,这意味着平台侧对 AI 生成内容的溯源能力在加强,交付前需要确认所用模型是否带 SynthID 水印。

做 AI 影像交付的可以留意:SynthID 水印加了滤镜也能查出来,平台侧的内容溯源会越来越严,接商单前先摸清自己用的模型带不带水印。

点击打开原平台查看,能否访问取决于网络环境

Gamma 5 发布:引擎重做,新增视觉叙事 Agent

Gamma 发布 5.0,官方称是史上最大更新,引擎从底层重做。新增面向视觉叙事的 Agent,可做头脑风暴、调研和编辑;设计上支持描述风格、提供视觉参考或由 Gamma 自动生成风格;编辑支持自由排版、自动排版和对话式修改三种方式。支持高保真导入导出 PowerPoint、PDF 及公司品牌素材并自动匹配,可直连 Slack、Notion、Salesforce 内容生成,也能从 Claude 和 ChatGPT 里创建 gamma。

Gamma 把引擎整个重做,加了会做视觉叙事的 Agent,能描述风格、喂参考图、导入 PPT/PDF 和品牌规范自动对齐。做提案和视觉稿的可以试一轮,看品牌一致性省不省事。

点击打开原平台查看,能否访问取决于网络环境

ImageFlow 免费上线浏览器版 Relight 打光功能

开发者 Yassine Bouanane 发布 ImageFlow 中的 Relight 功能正式版,可直接在浏览器中免费运行,照片不上传服务器、本地完成 AI 打光处理。他对比 Adobe 约一周前发布的 Relight 测试版:后者需订阅加每次渲染 30 个 AI 积分,且要把照片上传到服务器。

Adobe 的 Relight 还在测试收费,这边浏览器里免费跑、照片不上传服务器,做视觉和修图的可以拿自己的素材对比一下效果。

点击打开原平台查看,能否访问取决于网络环境

Google 推出 Playground 自定义游戏创建平台

Google AI Blog 官方发布 Playground,定位是创建和游玩自定义游戏的平台,原文仅给出「Overview of Playground」一句概述,未展开具体功能、技术方案或使用方式。对做互动叙事、游戏化短内容的创作者来说,这条目前只有产品名和定位,实际能不能用于内容生产要等官方放出更多说明。

Google 官方发布 Playground,主打创建和游玩自定义游戏,但原文只有一句概述,具体能力、是否用 AI 生成、怎么接入都没说,做游戏化内容或互动叙事的可以先收藏等细节。

点击打开原文

工具与能力

Tools

ChatGPT 上线 Intelligent UI,预告 GPT-6 全员开放

ChatGPT 官方账号宣布推出 Intelligent UI,让 ChatGPT 用完全交互式的用户界面快速回答问题,把日常回答变得更直观,帮助用户学习复杂主题,并能即时生成解决具体任务的小工具。同一条推文预告 GPT-6 即将登陆 ChatGPT,面向所有用户。GPT-6 的具体能力、上线时间和 Intelligent UI 的技术细节均未在原文中说明。

ChatGPT 官方放出交互式界面 Intelligent UI,回答能直接变成可点可操作的小工具,同时预告 GPT-6 面向所有用户。做 AI 工具链和内容自动化的可以先去试交互式输出能接进哪些环节。

点击打开原平台查看,能否访问取决于网络环境

ElevenLabs 上线 OpenRouter 并限时五折

OpenRouter 官方宣布接入 ElevenLabs 全系模型:9 个文本转语音模型,支持 90+ 语言;2 个语音转文本模型,带说话人标注和词级时间戳。所有 ElevenLabs 模型在 OpenRouter 上限时五折,截止 10 月 19 日上午 8 点(太平洋时间)。对做 AI 配音、字幕对齐、批量音频处理的后期团队来说,这意味着不用单独对接 ElevenLabs 官方接口,在 OpenRouter 一个入口就能调用,词级时间戳对字幕和口型对齐尤其有用。

配音和后期团队注意:9 个 TTS 模型加 2 个带说话人标注、词级时间戳的转写模型,现在一个 API 就能调,10 月 19 日前还打五折,做批量配音和字幕对齐的可以接上试一周。

点击打开原平台查看,能否访问取决于网络环境

HeyGen MCP 接入 Grok,用个人分身自动出新闻节目

HeyGen 官方演示:把 HeyGen MCP 作为自定义服务器接入 Grok @Bot,再设一个早间例程,就能让 Bot 抓取 X 上的新闻、用你的个人数字分身自动生成一档你本人出镜的每日新闻节目。整条流程是「抓新闻 → 写稿 → 数字人播报」的自动化,无需手动剪辑。做资讯口播、日更账号的团队可以照这个思路搭一套自动出片流程。

HeyGen 把 MCP 服务器接进 Grok Bot,设个早间例程就能把 X 上的新闻自动变成你本人出镜的日更节目。做日更口播、资讯号的可以搭一套跑跑看。

点击打开原平台查看,能否访问取决于网络环境

FLORA 接入最新 Google 图像模型

FLORA 宣布最新 Google 图像模型已在其平台可用,官方列出三项改进:更好的视觉风格贴合度、更强的构图与图像一致性、更高的细节与材质保真度。原文未给出模型具体版本号与参数。做视觉开发和角色设定的可以在 FLORA 里用同一组 prompt 跑一遍,对比风格贴合与多图一致性的实际表现。

FLORA 上线最新 Google 图像模型,官方点出风格贴合、构图与图像一致性、细节质感三项提升,做视觉开发和 KV 的可以拿同一组 prompt 对比一下出图稳定性。

点击打开原平台查看,能否访问取决于网络环境

Luma 上线换脸功能

Luma AI 官方在 X 上宣布 Luma 内新增换脸功能,并给出 app.lumalabs.ai 的 face-swap 使用入口。做角色替换、数字人换脸和短剧多角色镜头的团队,可以直接进 app 跑一遍,重点看跨镜头人脸一致性和边缘融合效果。

Luma 官方放出换脸入口,做角色替换、数字人换脸的可以进 app 试一轮,看跨镜头脸稳不稳。

FLORA MCP 可自建任意创意工具与特效

FLORA 官方账号发布 FLORA MCP,宣称可用它构建任意创意工具或特效。原文仅一句宣传语,未给出具体能力清单、接入方式或示例。对做 AIGC 工作流整合的创作者来说,MCP 接口意味着可能把 FLORA 的能力接进自己的自动化流程。

FLORA 把 MCP 接口开放出来,理论上能让创作者自己搭创意工具和特效,做工作流自动化的可以点进去看接入方式。

点击打开原平台查看,能否访问取决于网络环境

MiniMax H3-Max 重打光模型上线 fal

fal 平台上线 MiniMax H3-Max 重打光(relight)模型,提供在线体验入口 fal.ai/models/minimax/h3-max/relight。该条推文正文仅含体验链接,未给出模型参数、价格或效果说明。做视觉开发和后期调光的可以点进去实测,看它在已有素材上重打光的表现。

fal 上线 MiniMax H3-Max 重打光接口,做视觉和后期调光的可以接 API 跑一遍,看能不能替掉手动补光那一步。

Claude SDK 内置电脑与浏览器操作工具集

Anthropic 开发者账号宣布,Claude 的 Python 和 TypeScript SDK 现已内置 computer use 与 browser use 工具集。API 会告诉 Claude 想点击或输入什么,此前开发者需要自己写循环、把点击和按键映射成命令,现在 SDK 直接运行这套循环并把动作发给驱动执行。对做自动化工作流的技术整合者来说,浏览器操作和桌面操作的门槛降低,可用来串素材抓取、批量上传、跨平台发布这类重复环节。

以前要自己写循环把点击、输入映射成命令,现在 Python 和 TypeScript SDK 直接跑这套循环并驱动执行。做自动化流程和 Agent 的技术整合者可以接上试,看能不能把素材抓取、批量上传这类重复活交给它。

点击打开原平台查看,能否访问取决于网络环境

Higgsfield 上线 Ad Multiplier 广告工具

Higgsfield 在 Ads Studio 里上线 Ad Multiplier:输入一条跑得好的广告,它会拆解这条广告为什么有效,把这些规律套到你的产品上,再生成一批可直接投放测试的新广告。功能已在 Higgsfield 平台和 ChatGPT 扩展里上线。做投放素材和品牌短视频的团队,可以拿手上已验证的爆款当模板,批量产出变体测试。

把跑得好的广告拆解出爆点、套到自己产品上批量出新素材,投手和做品牌内容的可以拿现有爆款试一轮。

点击打开原平台查看,能否访问取决于网络环境

Recraft Studio 九月更新:可分享风格与拖拽参考图

Recraft 官方公布 Studio 与移动端九月更新:新增可分享的 Styles(风格可分享复用)、拖拽式参考图(drag-and-drop references)、画布对齐优化,以及新模型上线。对做视觉开发和 KV 的创作者来说,可分享风格意味着团队内能统一一套视觉语言,拖拽参考图则简化了风格迁移的输入流程。

Recraft 这波把「可分享风格」和「拖拽参考图」做进 Studio 和移动端,做视觉开发和 KV 的可以试一下风格复用顺不顺手。

点击打开原平台查看,能否访问取决于网络环境

Claude 九月更新:Chat 与 Cowork 合并,Opus 5.5 上线

Claude 发布九月更新:Chat 与 Cowork 合并为统一的 Claude,云端运行的任务在合上电脑后仍可继续。Claude Docs 支持团队与 Claude 在同一文档中协作编辑,新增 /slides、/docs、/designs 命令可直达对应格式。模型方面 Opus 5.5 承担重度任务,Sonnet 5.5 用于快速迭代编辑。

Chat 和 Cowork 合成一个入口,云端任务合上电脑还能接着跑,写剧本、整理分镜这类长活不用守着屏幕;Opus 5.5 扛重活、Sonnet 5.5 快改,做剧本和文案的可以试一周。

点击打开原平台查看,能否访问取决于网络环境

方法与经验

Methods

@nicebabycat 分享 15 个 Seedance 2.0 提示词技能

作者开源了一套 Seedance 2.0 提示词技能包,共 15 个,按电影感、3D、动漫、漫画转视频、打斗、电商广告、产品 360°、美食、房地产等风格分类。每个技能包含 10-12 种前 2 秒钩子开场、15 秒以内逐拍时间线、15 种以上运镜的英文写法、灯光/环境音/拟音/配乐写法,以及 @image1 @video1 素材引用用法。用法是把对应 SKILL.md 复制到 Claude 技能目录,一句话描述需求后生成 25 行以上提示词贴进 Seedance,每个技能带中文版。

15 个按风格分好的 Seedance 2.0 提示词技能包,每个都写死了前 2 秒钩子、逐拍时间线和运镜英文写法,做短剧和电商广告的可以直接抄进 Claude 用。

点击打开原文,能否访问取决于网络环境

Nano Banana 2.1 与 Flux 3 连续编辑漂移实测对比

有测试者对 Nano Banana 2.1 与 Flux 3 做了漂移基准对比:两模型从同一张图出发连续编辑 40 次,每次基于上一次结果(如「把背心改成红色」并要求其余不变),并在每张图中选三处 40 次都没被编辑过的背景区域(墙面、天花板、地板)作为对照,量化新图与原图的差异均值(0-255,0 为完全一致,数值越高漂移越重)。结果显示 Nano Banana 2.1 仅第一次略胜 Flux 3,后续几乎完败。做多轮修图和角色一致性的视觉师可参考这套测法。

40 次连续编辑后看背景有没有被偷偷改掉,这种测法比单张出图更接近短剧改镜头的真实场景。做角色一致性和多轮修图的视觉师可以拉这份对照数据,判断哪个模型扛得住反复改。

点击打开原平台查看,能否访问取决于网络环境

作者分享人脸微距提示词:绒毛毛孔清晰可见

推文给出一段可直接复制的 15 秒 9:16 竖屏 4K 超写实微距人像提示词:24-28 岁东亚女性 3/4 侧脸,强调 RAW 未修饰皮肤(毛孔、绒毛、雀斑、色素差异、油脂高光、唇纹),侧前方强暖光穿透虹膜形成琥珀色,背景近纯黑,85-105mm 微距镜头、机位距离 15-25cm、2%-4% 呼吸漂移,并附 0-3/3-6/6-9/9-12/12-15 秒的眼神与眼皮动作时间线。

一条可直接复制的 15 秒竖屏微距人像提示词,把绒毛、毛孔、油脂高光和 0-15 秒眼神动作拆成时间线,做数字人和特写镜头的视觉师可以存下来改参数。

点击打开原平台查看,能否访问取决于网络环境

作者称 Grok Bot 据提示词生成 Skill 宣传片

作者李岳(@liyue_ai)用 Grok Bot 为自己的开源项目 female-portrait-director 制作了一支宣传 Motion Video,全程只发了一段提示词:附上 GitHub 项目链接,要求「做一个比较炫酷的 Motion Video,发挥创意把视频做好一点」。成片一刀未剪,作者称音效、布局、场景切换都符合预期,中间不同写真风格展示的特效是亮点。据作者转述,马斯克当天下午提到 Grok Bot 使用最强的后端模型。

作者只丢了一句提示词加一个 GitHub 项目链接,Grok Bot 就出了带音效、场景切换和写真风格特效的成片。做工具宣传片和 Motion Video 的可以看看这个提示词写法。

点击打开原平台查看,能否访问取决于网络环境

OpenAI 列出 Decisions API 六类开发者用例

OpenAI Developers 官方列出 Decisions API 的六类开发者用例:把请求路由到正确的模型、工具或智能体;把规模化输入转成标签、排名和分数;分析图像、比较视觉内容或识别关键视频帧;从截图中选择按钮、导航表单或确定操作;标记有风险的工具调用;对大型数据集分类以发现趋势。其中「识别关键视频帧」和「比较视觉内容」与素材筛选、批量打标场景直接相关。

OpenAI 官方把 Decisions API 的六类用法摊开讲:模型路由、批量打标打分、识别关键视频帧、截图里选按钮、标记风险工具调用。做自动化剪辑和批量素材处理的可以对着这几条看哪条能接进自己的流程。

点击打开原平台查看,能否访问取决于网络环境

用 Opus 5.5 写 HTML/Three.js 测试旁白与动作

作者让 Opus 5.5 写 HTML/Three.js 完成文字排版与运动,旁白用 Gemini TTS,风声和敲门声用 ffmpeg 合成,全程未使用视频生成 AI,产出短片《冻结的手记》。作者反馈 Gemini TTS 旁白演技自然、听感舒适,文字动画相比视频生成不会崩字、修改快、数据体积小。

不用视频生成模型,靠 Opus 5.5 写 HTML/Three.js 做文字排版与运动,配 Gemini TTS 旁白和 ffmpeg 音效合成成片。做后期和动态字幕的可以看这条换条思路。

点击打开原平台查看,能否访问取决于网络环境

Arena 实测 Mistral Large 4:1T 参数 49B 激活

Arena 对 Mistral Large 4 做了实测(该产品 10 月 7 日已发布),该模型总参数 1T、激活 49B,开放权重预计月底放出。评测把它与 GPT-6.1 Sol、Astra、Claude Fable、Claude Opus 5.5、Claude Sonnet 5.5、Kimi K3、GLM 5.3 Flash、DeepSeek Flash、Muse Spark 等专有及开源模型做了真实场景对比,后续还会补充分数与更新。属于文本模型能力评测,不涉及图像、视频、音频的生成或编辑。

当天有 4 家独立信源在报同一件事,属于行业动向本身。对具体创作流程没有直接用处,但这个量级的消息值得知道。

作品与案例

Works

冰尖の霜语发布《春物》同人第3话

B 站 UP 主「冰尖の霜语」制作的《我的青春恋爱物语果然有问题》同人动画《春物语》第 3 话,剧情围绕侍奉部重启与雪之下雪乃、八幡的对话展开。制作方公开了完整工具清单:文本用 Opus-5.5、图片用 Image-2.5、音乐用 Suno-V6 mini、视频用 Seedance-2.5。

《我的青春恋爱物语果然有问题》同人动画第 3 话,UP 主公开了全套模型清单:Opus-5.5 写本、Image-2.5 出图、Suno-V6 mini 配乐、Seedance-2.5 生成视频。做二次元同人和 AI 动画的可以拉片看角色一致性和对白戏怎么处理。

点击打开原平台查看

微信公众号 光影漫游AI 二维码
觉得日报有用的话,欢迎关注微信公众号,AI 影视创作的内容都在那里。
光影漫游AI
微信内长按二维码识别,或复制名称到微信搜索