← 全部日报

AIGC 信息日报

2026 年 8 月 19 日 周三

行业与平台

Industry

昆仑万维发布 Mureka V9.5,人声良品率升至 61%

昆仑万维发布新一代 AI 音乐生成模型 Mureka V9.5,基于 MusiCoT 框架,强调编配留白、人声自然与意图精准执行。人声表现良品率升至 61.0%,控制良品率达 97.0%,曲风完全体现比例 95.7%。V9.5 大幅优化中文国风作品咬字与和声编排,基于超 2.5 万份用户反馈迭代,现已全平台陆续开放。

做 AI 短剧配乐和后期配音的可以实测一轮,中文国风咬字和和声编排是这次重点,人声良品率数据值得跑一遍验证。

GLM-5.3 上线 OpenRouter,纯后训练提升显著

智谱 GLM-5.3 已在 OpenRouter 上线,与 GLM-5.2 同基座,提升全部来自后训练。Terminal-Bench 3.0 从 4.6 升至 28.3,DeepSWE v1.1 从 46.2 升至 66.9。对 AIGC 创作者来说,这是编程/Agent 方向的模型更新,与视频、图像生成等创作工作流无直接关联,但技术整合者可关注其 API 接入能力。

编程 Agent 团队可以接 API 实测,Terminal-Bench 从 4.6 跳到 28.3,提升幅度值得跑一遍验证。

点击打开原文,能否访问取决于网络环境

Cartesia 发布 Sonic-3.6 实时语音模型,登顶两大榜单

Cartesia 发布实时文本转语音模型 Sonic-3.6,距 3.5 版约三个月,主打自然度提升。在 Artificial Analysis 两大语音榜单均列第一:Provider Voice 榜 1283 Elo,Controlled Voice 榜 1123 Elo,超越 ElevenLabs Eleven v3。基于状态空间模型,首音频延迟低于 90ms,现以 beta 版和托管 API 提供,定价每 100 万字符 49 美元,无开源权重。

做配音和虚拟角色对话的可以接 API 试一周,首音频延迟低于 90ms,实时对话场景的体验会明显不一样。

点击打开原文

微软 MAI-Image 登顶图像编辑榜第三,Foundry 私测开放

微软 AI 官方宣布其最新 MAI-Image 模型在 Arena 图像编辑排行榜升至第 3 名,并已在 Microsoft Foundry 平台开放 Private Preview 私测。该模型定位图像编辑能力,具体编辑功能细节和参数未在推文中展开。

微软自家图像编辑模型在 Arena 榜单爬到第三,视觉师可以关注下它在风格化编辑上的表现,做海报和概念图的可以蹲个私测资格。

点击打开原平台查看,能否访问取决于网络环境

Tripo P2.0 预览版发布,原生四边形拓扑面向游戏实时工作流

Tripo 发布 P2.0 预览版,主打原生四边形拓扑,最高支持 50K 三角形 / 25K 四边形,专为游戏和实时渲染管线设计,每位用户可免费生成 2 次。对做 3D 资产、游戏场景和实时渲染的视觉师来说,四边形拓扑能减少后期重拓扑工作,直接进引擎用的效率更高。

做 3D 资产和游戏向视觉的可以试一下,原生四边形拓扑对后续绑定和引擎导入友好,每人送 2 次免费生成,够跑一轮测试。

点击打开原平台查看,能否访问取决于网络环境

FishAudio 推出 FishCreative 创作平台,语音图像视频一站式

FishAudio 推出创作者平台 FishCreative,主打把任意想法转化为角色、场景和可直接发布的视频,整合语音、图像、视频和口型同步能力于一个创作空间。面向 AI 短剧和角色 IP 创作者,一站式流程有望减少多工具切换成本。

做 AI 短剧和角色 IP 的可以关注,语音、图像、视频、口型同步收进一个创作空间,从想法到成片不用切工具,值得跑一遍看流程顺不顺。

点击打开原文,能否访问取决于网络环境

OJO 推设计智能体工作台,可组建团队并导出 Figma

OJO 推出首个设计智能体团队工作台,可组建负责产品策略、视觉、文案与原型的设计智能体团队,调用 300+ 技能,将自然语言想法转化为 PRD、页面结构、UI 及可编辑原型,并支持导出 Figma 或通过 CLI 接入 Claude Code、Codex。

做 AI 产品和技术整合的可以看看,设计智能体团队能直接串进现有工作流,接 Claude Code 或 Codex 用。

点击打开原平台查看,能否访问取决于网络环境

工具与能力

Tools

Pika 详解 Soundtrack 音频生成技术架构

Pika 官方介绍 Soundtrack 音频生成功能的技术架构:将视频压缩为保留时序、运动、场景布局的潜在 token,提示词转为语义 token 指定应听到的内容,由潜在扩散 transformer 在去噪时对两者做交叉注意力,实现视频与音频的对齐生成。

Pika 官方拆解 Soundtrack 的技术原理:把视频压成保留时序、运动、场景布局的 latent token,再用扩散 transformer 交叉注意力生成音频。做 AI 后期和声音设计的可以看看这套对齐逻辑,理解视频到音频的映射思路。

点击打开原平台查看,能否访问取决于网络环境

Comfy MCP 本地化并开源,Agent 可直接操控工作流

ComfyUI 官方宣布 Comfy MCP 改为本地运行并开源,回应 6 月 Comfy Cloud MCP 上线后的最高呼声。本地版让 Agent 直接读取本机安装的节点(含自定义节点)和磁盘上的模型,可获取文件、启动实例、将工作流推进到可运行状态。对 AIGC 技术整合者来说,这意味着可以把 ComfyUI 工作流直接接入自己的 Agent 调度链路,实现本地自动化批量出图。

ComfyUI 官方把 MCP 服务改成本地运行并开源,Agent 能直接读取你本机的节点、自定义节点和模型文件,还能自动启动实例、把工作流跑到可运行状态。做 AI 工作流自动化的可以直接接上试,省掉云端中转。

点击打开原平台查看,能否访问取决于网络环境

HeyGen 上线 Brand Kits:预设品牌字体 Logo 色号

HeyGen 推出 Brand Kits 功能,可预设品牌字体、Logo、精确十六进制色号,以及数字人播报产品名时的发音术语表。设置后生成的每条视频自动保持品牌一致性,无需重拍。

做品牌定制视频和短剧 IP 的可以试试,把字体、Logo、色号、产品名发音一次性喂进去,之后每条视频自动对齐品牌,不用反复返工。

点击打开原平台查看,能否访问取决于网络环境

MiniMax H3 上线 DomoAI,支持多模态参考生成

DomoAI 平台正式接入 MiniMax H3 模型,支持文本、图像、音频、视频四种模态输入生成视频,并推出 Omni Reference 功能,可在单次创作中组合最多 9 张图片、3 段视频和 3 段音频作为参考。

DomoAI 接入了 MiniMax H3,文字、图片、音频、视频四种输入都能出片,还能一次混搭 9 图 3 视频 3 音频做参考。做短剧和视觉的可以上手试一周,看多模态参考对角色一致性的提升值不值。

点击打开原平台查看,能否访问取决于网络环境

FLORA Fashion Studio 手绘草图一键转写实服装渲染

FLORA 的 Fashion Studio 功能可将手绘草图直接转换为写实服装渲染图,并支持将结果导入 Canvas 画布进行进一步迭代调整。面向服装设计、电商视觉和角色造型等场景,缩短从草图到成品视觉的流程。

做服装设计、电商视觉和角色造型的视觉师可以试试,手绘草图直接出写实服装渲染,还能拖进 Canvas 继续迭代,省掉重新建模的功夫。

点击打开原平台查看,能否访问取决于网络环境

Claude Cowork 移动端与网页版全面上线

Claude 官方宣布 Cowork 功能现已面向所有付费套餐开放移动端和网页版使用。Beta 版将在未来几周内逐步推出,首先面向 Max 套餐用户,随后覆盖更多套餐。该功能支持在移动设备上访问和协作 AI 工作区。

Claude 的协作工作区功能 Cowork 从桌面端扩展到移动端和网页版,做 AI 工作流编排的可以试试在手机上随时调度任务。

点击打开原平台查看,能否访问取决于网络环境

Claude 接入 Gmail 与 Google Drive,可代发邮件管理文件

Claude 官方宣布新增 Gmail 与 Google Drive 连接器:可让 Claude 回复邮件线程并自动起草发送,用户可控制审批节点;也能管理 Drive 中的文件。从连接器菜单即可接入,所有付费套餐可用。对创作者来说,这打通了 AI 与日常办公/素材管理工具的直接交互,适合作为内容生产流程中的协作与归档环节。

Claude 官方宣布接入 Gmail 和 Google Drive,能起草并发送邮件回复、管理云端文件,所有付费套餐可用。做 AI 短剧和内容团队的可以接上,让 Claude 直接处理素材归档和协作沟通,省掉来回搬运的功夫。

点击打开原文,能否访问取决于网络环境

Perplexity 称 DeepSeek V4 Pro 成本低 62%

Perplexity 宣布 DeepSeek V4 Pro(美国托管)现已接入 Perplexity Computer 智能体。官方在 WANDR 基准上对比,该模型得分 0.359,每任务成本 0.75 美元,比成本性能前沿的下一名便宜 62%。对 AIGC 技术整合者来说,这是把高性价比推理模型接入自动化工作流的一个新选项,可评估其在批量生成、媒体处理等任务上的成本收益。

Perplexity 把 DeepSeek V4 Pro 接进 Computer 智能体,跑 WANDR 任务成本比同档低 62%。做自动化工作流的可以接上试试,看能不能省一笔推理开销。

点击打开原文,能否访问取决于网络环境

企业微信升级 CLI 与 MCP,自建 AI Agent 可接入

企业微信全面升级 CLI 与 MCP 能力,WorkBuddy、Deepseek Harness、Minimax Code 等主流 AI Agent 可直接调用文档、表格、邮件、会议、日程、通讯录等十大办公能力模块。企业还可通过开放接口接入自研 Agent,该能力面向所有规模企业开放,无人数、资质门槛。

企业微信开放 CLI 与 MCP 接口,自建 Agent 可直接调用文档、表格、会议等办公模块。做 AI 工作流整合的可以看看,但和影视创作关系不大。

点击打开原平台查看,能否访问取决于网络环境

方法与经验

Methods

Pika 实测 Seedance 2.5 后期换景:绿幕替换科幻战场

Pika 官方账号展示 Seedance 2.5 在 1080p 下的后期能力:将绿幕背景替换为科幻战场,延展武器设计,并添加火花、爆炸、氛围和交互光,同时保持特技动作节奏不变。

后期和视觉师可以看看:绿幕替换、武器延展、火花爆炸和交互光一次做完,动作节奏没动,省掉传统合成工序。

点击打开原平台查看,能否访问取决于网络环境

Asana 用 Codex 两周完成五年工程量

OpenAI 官方博客发布客户案例:Asana 用 Codex 在两周内替换了过时的测试系统,完成原本预计需五年、成本约 1.2 万美元的工程量。展示了 AI Agent 在工程自动化上的效率提升。

OpenAI 官方客户案例:Asana 用 Codex 两周替换旧测试系统,省下五年工程量、成本约 1.2 万美元。做 AI 自动化工作流的可以看这套 Agent 调度思路能省多少人力。

Gemini 3.7 Flash 一键生成视差动画网页

Google AI for Developers 官方演示:Gemini 3.7 Flash 从一条提示词自动构建带视差动画的交互式落地页。底层由 3.7 Flash 调度工具,调用 Nano Banana 生成图像参考、Omni 渲染支持视差效果的视频,并自动产出文案。展示了多模型协作完成从文案到视觉再到动态效果的完整网页生成流程。

官方演示 Gemini 3.7 Flash 自动调度 Nano Banana 和 Omni 生成文案、图像和视差视频,一条提示词出完整交互落地页。做 AI 视觉和工具链整合的可以拆解这套多模型调度逻辑。

点击打开原平台查看,能否访问取决于网络环境

MiniMax H3 三人物运镜提示词:48 小时打磨遮挡环绕长镜头

创作者分享 MiniMax H3 三人物运镜提示词,耗时 48 小时打磨。核心是遮挡衔接式贴身环绕长镜头:三人各做一套完整近距离环绕(脚→头,水平绕到侧后方),摄影机不停不切,当前人物身体贴近镜头形成前景遮挡,摄影机绕过后下一个人从遮挡后突然被发现。完整提示词已开源在 GitHub。

做 AI 短剧和长镜头运镜的可以点开 GitHub 看完整提示词,遮挡衔接式贴身环绕的写法是现成模板,直接套用能省不少调参时间。

点击打开原平台查看,能否访问取决于网络环境

Magnific 演示单提示词+单参考图生成 30 秒短片

Magnific 官方演示:仅用一条提示词加一张分镜参考图,即可生成 30 秒、16:9、宽银幕变形镜头感的 16mm 电影风格短片。提示词指定无音乐、仅自然声,分镜参考图中每个面板按阅读顺序成为一个节拍,保持相同角色、颗粒感和褪色质感。

官方演示单提示词加一张分镜参考图直接出 30 秒短片,镜头、角色、颗粒感都跟着分镜走。做短剧和视觉的可以点开看这条工作流怎么串的。

点击打开原文,能否访问取决于网络环境

Magnific 演示 Seedance 2.5 复刻 90 年代动画风格

Magnific 官方演示 Seedance 2.5 生成 90 年代风格动画短片,并公开提示词思路:明确年代而非笼统的 anime style、补充红色夹克/金色卷发/镀铬细节等具体元素、让镜头自然运动。该功能由 BytePlusGlobal 提供,现已集成至 Magnific 平台。

做视觉和短剧的可以点开看,Seedance 2.5 复刻 90 年代动画的提示词思路——点名年代、给具体细节、让镜头自然动,直接套用跑一遍看效果。

点击打开原平台查看,能否访问取决于网络环境

GPT Image 2 与 Seedance 2.5 融合真人实拍与手绘线稿

创作者 Sairah 分享用 GPT Image 2 和 Seedance 2.5 制作真人实拍与 2D 手绘线稿动画融合的提示词。核心是电影感真人影像与俏皮轮廓描摹风格转换,全程第一人称视角,手持蓝铅笔描摹现实物体,所到之处实拍画面渐变为 2D 插画。场景涵盖火车、橘猫、巴士、女孩四个转场,每个都设计了从实拍到线稿/粉彩插画的平滑转换,整体明亮自然日光、当代都市氛围。

创作者分享用 GPT Image 2 和 Seedance 2.5 做真人实拍与 2D 手绘线稿无缝融合的完整提示词,含第一人称视角和逐场景转场设计,视觉师和编导可直接套用做风格化短片。

点击打开原平台查看,能否访问取决于网络环境

开源 local-image-gen 聚合本地多模型生图

开发者 DandreYang 开源 local-image-gen,一站式本地多模型生图聚合工具。打通 Codex、Grok、Antigravity、Cursor 的本地订阅额度,可在 Claude、Cursor、OpenCode 等 Harness 中调用,支持 gpt-image-2、grok-imagine-image-2.0、Nano Banana Pro 等模型,可指定比例与清晰度,支持并发生图,并兼容自定义 API_KEY 与 API_BASE 中转站。

把 Codex、Grok、Cursor 等已订阅的生图额度统一调度,支持并发和自定义中转 API,做视觉和短剧的可以装起来当本地生图工作流用。

点击打开原平台查看,能否访问取决于网络环境

创作者实测 InVideo Agent Two 生成伪纪录片恐怖片

创作者 @CharaspowerAI 用 InVideo 的 Agent Two 挑战严肃电影项目:生成 2 分钟以上伪纪录片恐怖片序列,要求包含重复角色、幽闭洞穴环境、渐强紧张感和一致的视觉规则。属于 Agent 自动生成长叙事片段的实测,验证 AI Agent 在复杂叙事任务上的能力边界。

用 InVideo 的 Agent Two 挑战 2 分钟伪纪录片恐怖片,带重复角色和洞穴环境,做 AI 短剧的可以看看 Agent 自动出片能到什么程度。

点击打开原平台查看,能否访问取决于网络环境

Magnific 公开 GPT-2 风格化编辑完整 Prompt

Magnific 官方账号分享内容创作者实现某种风格化编辑效果的方法:核心是 GPT-2 模型配合 Magnific 工具,官方公开了完整 prompt 供直接使用,一张输入图加一个提示词即可完成编辑。

官方直接甩出完整 prompt,一张图一个提示词就能出风格化编辑,视觉师可以拿去当模板套用,省得自己调半天。

点击打开原文,能否访问取决于网络环境

作品与案例

Works

PixVerse 纯 AI 动画短片获抖音未来导演计划最佳短片

PixVerse 官方发布纯 AI 动画短片,由 @run66667802 执导、与 @LootPixverse 合作,重新构想古老草原。故事讲年轻人返乡发现妹妹变成被诅咒的恶魔 Mangus,核心冲突是选择永陷黑暗换取所爱之人安宁。该片获抖音未来导演计划(隶属中国金鸡百花电影节)最佳短片奖。

PixVerse 官方推的纯 AI 动画短片,拿了抖音未来导演计划最佳短片,做 AI 短剧和动画的可以拉片看叙事和视觉风格怎么撑起一个完整故事。

点击打开原平台查看,能否访问取决于网络环境

B站网友共创AI军官督学角色上线

B站UP主发布《凛冬督学局》新督学官「克劳斯·韦伯」,为B站AI创造公开赛参赛作品,基于70亿Token训练数据,结合网友建议迭代更新,网站地址redwatch.top。系列含多个AI军官角色,主打AI角色监督学习场景。

B站AI创造公开赛参赛作品,网友共创迭代的AI军官角色,做AI短剧和角色IP的可以拉片看社区反馈驱动的角色迭代玩法。

点击打开原平台查看

30秒第一人称骑云龙穿越奇幻山谷AI短片

Shoaib AI(@AiwithShoaib)发布的AI短片,30秒第一人称连续飞行镜头,骑乘云龙穿越奇幻山谷,无剪辑、无过渡、无速度变化,照片级真人自然纪录片风格,1080p。龙为毛绒质感、猫形圆头、无角无刺,耳朵和毛发随速度与风自然反应;骑手仅露双手和亚麻袖口。分四段:金色时刻掠过山城、高速俯冲穿越城市、丛林山谷贴树梢飞行、沿河掠水激起水花。

一段30秒第一人称骑云龙穿越奇幻山谷的AI短片,无剪辑单镜头,照片级自然纪录片风格。做AI短剧和视觉的可以拉片看长镜头连贯性和角色(龙)一致性处理。

点击打开原平台查看,能否访问取决于网络环境

创作者用 Codex 搭三星堆小游戏获小红书开屏推荐

创作者 Ring Hyacinth 用 Codex 搭建三星堆&金沙文物场景小游戏,部分资产来自 @HanyangWang 的 Funes,作品获得小红书开屏推荐。个人创作者用 AI 编程工具完成场景搭建并获平台流量扶持的案例。

个人创作者用 Codex 搭文物场景小游戏拿到小红书开屏推荐,做 AI 互动内容和视觉场景的可以看看这个玩法,验证了个人小团队也能做出平台级曝光。

点击打开原文,能否访问取决于网络环境

微信公众号 光影漫游AI 二维码
觉得日报有用的话,欢迎关注微信公众号,AI 影视创作的内容都在那里。
光影漫游AI
微信内长按二维码识别,或复制名称到微信搜索