← 全部日报

AIGC 信息日报

2026 年 9 月 25 日 周五

行业与平台

Industry

Gemini 3.8 Live 新增 Live Avatar 功能

Gemini 3.8 Live 新增 Live Avatar 功能(该产品 9 月 17 日已发布),把实时对话能力和低延迟流式视频生成原生结合,实现带动态视觉形象的实时交互:精确口型同步、自然表情、流畅的对话轮次切换。该功能即日起在 Gemini Enterprise 中可用,官方展示了多种不同外观、声音和表现力的角色。适用于客服、交互式导览等企业场景。做虚拟角色、数字人对话和实时交互内容的团队可以关注其口型与表情同步的实际表现。

实时视频生成配上语音对话,口型、表情、轮次切换都做了,做虚拟角色和数字人客服的可以接进 Gemini Enterprise 试一周。

点击打开原文

Wonder Studios 联手 Artlist 办广告制作大师课

Wonder Studios 与 Artlist 合作举办线上大师课,由 @marcusgrip 拆解一个商业广告制作案例,覆盖客户沟通、工作流、prompt 和完整制作流程,时间为 9 月 30 日。同期开放 Built to Brief 挑战赛,奖品为 5 份 Artlist AI Creator 订阅,第一名获全年订阅加 24 万积分。

直播课会拆一个真实商业广告案例,从客户需求到工作流、prompt 全流程讲一遍,做广告和产品图的可以蹲。同期还有 Built to Brief 挑战赛,第一名拿一年 Artlist AI Creator 订阅加 24 万积分。

点击打开原平台查看,能否访问取决于网络环境

工具与能力

Tools

Midjourney 更新无缝贴图与精准局部重绘

Midjourney 官方发布三项更新:v8.1 和 v8.2 版本推出新版 --tile 参数,用于生成无缝拼接图案;新版局部重绘(inpainting)只修改用户框选的像素区域;同时在 alpha 站点放出实时模型的早期预览版本。

做视觉开发和海报物料的可以试:--tile 无缝图案在 v8.1/v8.2 更新,局部重绘只改你框选的像素,另外 alpha 站放出了实时模型的早期预览。

点击打开原平台查看,能否访问取决于网络环境

Krea Agent 上线自定义应用,描述即可生成创作工具

Krea 在 Krea Agent 中推出自定义应用(custom apps)功能,用户只需用自然语言描述想要的工具,即可搭建自己的创作工具,官方给出的示例方向包括角色工作室(character studios)、3D 查看器(3D viewers)和动效(motion effects)。官方表示更多说明和示例见链接。对做角色设定、视觉开发和动效的创作者来说,这类「描述即生成工具」的能力意味着可以把重复性的角色管理、素材查看、动效生成流程固化成自己的小工具,减少在多个界面之间来回切换。

Krea Agent 现在能用一句话描述生成专属小工具,官方点名角色工作室、3D 查看器、动效三类。做角色一致性和批量出图的视觉师可以先去搭一个角色工作室试试。

点击打开原平台查看,能否访问取决于网络环境

OpenRouter 上线工具调用:联网搜索、生图、跑 shell

OpenRouter 官方转发宣布平台新增工具能力,免费和付费都有,首批包括联网搜索、图像生成、运行中途调用其他模型、完整 shell 以及 datetime()。对做自动化创作流程的团队来说,这意味着可以在一次模型调用里串起搜索素材、生成图片、切换模型等步骤,不用自己分别对接各家接口。

OpenRouter 给模型调用加了工具层,联网搜索、生图、中途调别的模型、跑 shell 都免费付费可选,自己搭自动化流程的可以接上试试。

点击打开原文,能否访问取决于网络环境

Chrome 版 Gemini 可解析音视频内容

Google 扩展 Chrome 中的 Gemini 能力:对几乎任何音频或视频文件,在完整播放一遍后,可自动识别关键要点、定位特定信息、解释难懂片段。功能面向浏览器内的音视频内容理解,属于 Chrome 端 Gemini 的功能扩展。对做素材整理、访谈转写、拉片笔记的后期和编导来说,这是浏览器里直接读片的新入口,但具体支持的格式、时长上限和地区开放情况原文未说明。

Chrome 里的 Gemini 现在能对播放过的音视频做要点提炼、信息检索和疑难片段解释,做素材整理和拉片笔记的后期可以试一下省不省事。

点击打开原平台查看,能否访问取决于网络环境

Google 新增 15 款 Remix 模板:随手拍变红毯照

Google 官方账号发布消息,新增 15 款 Remix 模板,可将随手拍照片转成红毯时刻、拍立得连拍条等风格化成品。原文仅给出模板数量与两类效果示例,未说明具体所属产品、可用平台或生成参数。做社媒物料、海报和人物风格化出图的视觉创作者可关注其模板化出图能力。

Google 官方放出 15 款 Remix 模板,把随手拍照片一键改成红毯照、拍立得连拍条这类风格化成品。做社媒物料和海报的视觉师可以拿它当快速出图模板试,看风格化效果够不够用。

点击打开原平台查看,能否访问取决于网络环境

Krea 即将接入 Muse 平台

Krea 官方账号发布预告,称 Krea 即将接入 Muse 平台,并附一句「你想让 Muse 先做什么」的互动提问。除接入意向本身外,官方未给出功能形态、上线时间或支持范围等任何细节。对用 Krea 做视觉开发和出图的创作者来说,这条目前只是接入信号,实际能调用什么能力要等正式上线才能判断。

Krea 官方放话要进 Muse,正文只有一句预告加一句互动提问,具体形态和上线时间都没说。用 Krea 出图出片的可以留意后续,现在还没什么可上手的。

点击打开原平台查看,能否访问取决于网络环境

方法与经验

Methods

Midjourney 发布新编辑模型使用视频

Midjourney 官方发推称,很多人在问新编辑模型怎么用来做角色一致性和其他效果,因此专门做了一支演示视频。推文本身只有这一句说明加视频链接,具体操作步骤和参数需看视频内容。对做角色 IP、系列图、分镜视觉开发的创作者来说,官方亲自出教程意味着这套角色一致性用法已被验证,值得跟着视频跑一遍。

Midjourney 官方针对新编辑模型的角色一致性用法出了演示视频,做角色 IP 和系列图的视觉师可以跟着跑一遍,看它怎么把同一张脸稳定复用。

点击打开原平台查看,能否访问取决于网络环境

@gkxspace 称剪映出 Agent 并推荐逆向项目

作者称剪映今天上线 Agent,走封闭全家桶路线、能力只在软件内、卖 AI 会员、不开放第三方调用。他推荐逸尘的逆向开源项目,思路相反:把剪辑软件控制权交给外部 Agent,可用 Codex 一条指令批量粗剪几十条视频、加字幕、配 BGM;用几分钱的 DeepSeek 配合豆包 ASR,一小时视频成本不到一块钱;产出仍是剪映原生工程,可打开人工微调。作者提醒该项目随时可能 404,建议尽快 Fork。

剪映 Agent 走封闭全家桶,这套逆向方案反过来把剪辑控制权交给外部 Agent:Codex 一条指令批量粗剪加字幕配 BGM,一小时视频成本不到一块钱,做批量口播和短视频后期的可以 Fork 一份存着。

点击打开原文,能否访问取决于网络环境

开源工具 OpenCreator 单机跑通长视频翻译配音分发

GitHub 1.1 万星标的开源桌面端工具 OpenCreator,输入 40 分钟长视频或公开视频链接后单次运行完成字幕断句、多语种翻译、语音配音,自动估算口播语速对齐音轨,文本过长时调用语言模型精简成口语表达;跑完可自适应竖屏排版并生成封面素材,对应 YouTube、TikTok、B站、抖音规格。底层模型和 TTS 服务支持自由配置,本地运行不按分钟付费。

40 分钟长视频一次跑完字幕断句、多语种翻译、配音和竖屏适配,做视频出海和矩阵分发的后期可以拉回本地试一周,省掉按分钟付费的切片订阅。

点击打开原平台查看,能否访问取决于网络环境

博主用 Gemini 复刻商业级食品宣传片并公开分镜脚本

博主 @CrazyKaomei 称,过去一分钟报价 1000 元起步的商业级食品宣传片,现在普通人坐在电脑前两分钟就能复刻,并公开了完整分镜脚本和视频生成提示词,建议有 Gemini 会员的用户直接上手试。对做广告片和商业短视频的团队来说,这是一份可直接套用的食品类广告复刻流程,值得对照自己的报价和交付周期重新算一遍账。

一条商业食品广告片过去一分钟报价 1000 元起步,现在两分钟就能复刻,作者把完整分镜脚本和视频提示词都放出来了。接广告单的制片和视觉师可以照着跑一遍,看看自己那套报价还站不站得住。

点击打开原平台查看,能否访问取决于网络环境

微软 AI 负责人称 MAI-Image-2.6 刷新文生图性价比

微软 AI CEO Mustafa Suleyman 发推称 MAI-Image-2.6 具备「全球图像生成最佳性价比」,生成质量更高、更便宜更快,并提到近几周 Muse Image、MAI-Image-2.6 和 GPT Images 2.5 一起推动了文生图在价格与速度上的帕累托前沿。推文未给出具体单价、出图速度或对比数据。

微软 AI 负责人自己下场说 MAI-Image-2.6 把文生图的价格和速度往前推了一截,还点名 Muse Image、GPT Images 2.5 同批。做批量出图的可以拿同一批 prompt 跑三家比单价和出图速度。

点击打开原平台查看,能否访问取决于网络环境

作者称用 Seedance 2.5 追求糟糕画面以增强恐怖感

创作者 Pierrick Chevallier(@CharaspowerAI)分享用 Seedance 2.5 做恐怖片质感的思路:刻意追求糟糕的自动对焦、摇晃构图、空荡建筑和容易被忽略的细微细节,认为画面越糙恐怖感越可信,并公开了完整 30 秒提示词。做恐怖、悬疑、伪纪录片风格的编导和视觉可以拿这套 prompt 跑一遍,看模型对失焦和手持晃动这类「缺陷美学」的还原度。

反着来的思路:用失焦、晃镜、空建筑堆恐怖感,作者说这是他在 Seedance 2.5 里刻意推的方向,附完整 30 秒提示词。拍恐怖/悬疑向的可以抄这套 prompt 试一遍。

点击打开原平台查看,能否访问取决于网络环境

Opus 5.5 迭代重设计个人网站并生成预告片

X 用户 Thariq(@trq212)用 MAX 订阅让 Opus 5.5 批量生成个人网站重设计方案,通过工作流让模型自我迭代和批判,最终方案命中了他想要的调性;随后他又让模型把整个迭代过程做成一支预告片。属于个人使用体验分享,展示了用工作流驱动模型自我批判、并把过程素材二次加工成视频的思路。

用工作流让模型自己迭代+批判设计方案,再把迭代过程剪成预告片,做视觉开发和提案演示的可以看看这套「让 AI 自己挑刺」的玩法。

点击打开原平台查看,能否访问取决于网络环境

Gumvue Studio 展示深度图与姿态生成工具

Gumvue Studio 发布 Depth Map & Pose Generator 工具,可逐帧提取同步的深度估计图,并叠加 MediaPipe 骨架。演示视频使用 Minimax H3 模型生成。该工具面向需要从视频中提取深度信息和人体姿态数据的场景,可用于 AI 视频转绘、动作捕捉参考、后期合成等流程。

逐帧导出深度图和 MediaPipe 骨架叠加,做 AI 视频转绘、动作参考、后期合成的可以试一下这个工具。

点击打开原平台查看,能否访问取决于网络环境

@nicdunz 在 Krea Agent 做图片转烫金贴纸应用

Krea 官方转发用户 @nicdunz 的作品:在 Krea Agent 里搭了一个自定义应用,把任意图片转成烫金贴纸效果,支持拖动倾斜查看、切换不同质感(finish)。这是 Krea Agent 自定义应用能力的一个用例展示,作者附了可直接试用的链接。做视觉开发和物料设计的可以看看这类小应用怎么搭,判断能不能套到自己的出图流程里。

Krea Agent 里能自己搭小应用了,这条把图片转成可拖动、可换质感的烫金贴纸。做视觉和物料的设计师可以点开试一下手感,想想自己那套流程能不能也搭一个。

点击打开原平台查看,能否访问取决于网络环境

宝玉用 GPT 6 Astra 一条提示词做 3D 桃花源网页

宝玉回应此前「桃花源」作品被批不好看,重做了「牛来」版桃花源,用 GPT 6 Astra 以一条提示词 one-shot 生成完整可交互 3D 网页,并公开了提示词与制作方法,附可直接打开的网页链接。他自评 3D 水平有限、视频录制效果一般,建议直接打开网页体验。对做 AI 交互视觉和网页生成的创作者来说,这条的价值在于一条提示词产出完整 3D 场景的可行性样本,以及可复用的提示词写法。

一条提示词 one-shot 出完整可交互 3D 网页,作者把提示词和做法都放出来了,做 AI 网页/交互视觉的可以打开链接自己转一圈,看这套做法能不能挪到自己的项目里。

点击打开原平台查看,能否访问取决于网络环境

作品与案例

Works

B站AI短剧《大明14444》多集视频

B站 UP 主「星海大明锦衣卫AIGC」的 AI 系列短剧《大明14444》,把大明、星舰、修仙、书院等元素混搭成一个连续世界观,单集 1-,已更新数十集,另有「AI全民制作人」标签下的星球经营支线。做 AI 短剧的可以看它如何用短集数维持角色和世界观连续性。

B站 UP 主「星海大明锦衣卫AIGC」的 AI 系列短剧,大明+星舰+修仙混搭世界观,单集 1-,做 AI 短剧的可以拉片看它怎么用短集数铺长线叙事。

点击打开原平台查看

B站 AI 作品《道士也怕鬼》第九集

B 站 UP 主「旋转皮坨」发布的 AI 短剧《道士也怕鬼》第九集,属「AI 全民制作人」系列,题材为道士捉鬼向的剧情短剧,已更新至第九集,说明是持续连载的系列作品。做 AI 短剧的可以拉片看它多集连载下的人物一致性和叙事节奏处理。

B 站 UP 主「旋转皮坨」的 AI 短剧系列更新到第九集,做 AI 短剧的可以拉片看它怎么处理连续剧集的人物一致性和节奏。

点击打开原平台查看

微信公众号 光影漫游AI 二维码
觉得日报有用的话,欢迎关注微信公众号,AI 影视创作的内容都在那里。
光影漫游AI
微信内长按二维码识别,或复制名称到微信搜索