← 全部日报

AIGC 信息日报

2026 年 8 月 14 日 周五

行业与平台

Industry

Gemini 3.7 Flash 上线:速度快、价格降 50%

Google Labs VP Josh Woodward 发布 Gemini 3.7 Flash:速度快,价格比 3.6 Flash 低 50%(持续至年底),智能水平在约 3 周内大幅提升,得益于算法改进,已上线 API、AI Studio、Antigravity 等平台。DeepMind 官方补充称,新模型在调试、问题解决等关键编码任务上较 3.6 Flash 有显著提升,能用更少的提示词做出可用的网页布局和应用。对做 AI 后期和工具链整合的创作者来说,降价 50% 意味着批量转写、字幕生成、Agent 自动化等跑量场景的成本直接减半,值得接 API 实测。

Google 官方 VP 亲自发布,3.7 Flash 主打速度和降价,智能水平 3 周内大幅提升,已上线 API 和 AI Studio。做自动化剪辑、批量转写、Agent 工作流的可以直接接 API 测成本,降价 50% 对跑量项目是实打实的利好。

点击打开原文,能否访问取决于网络环境

DeepSeek-V4-Pro 正式版上线,增强 Agent 能力

DeepSeek 官方介绍 V4 Pro 正式版(该产品 8 月 13 日已发布),已同步在 APP、网页端和 API 更新上线,用户可在 APP 或网页端选择「专家模式」使用。正式版增强 Agent 能力,API 原生支持 OpenAI Responses API 格式并适配 Codex。对 AIGC 技术整合者来说,API 兼容 OpenAI 格式意味着现有基于 OpenAI 的创作自动化链路可低成本迁移,Agent 能力增强对批量生成、自动化剪辑等流水线有直接价值。

DeepSeek 官方推广 V4 Pro 正式版(该产品 8 月 13 日已发布),Agent 能力增强,API 原生支持 OpenAI Responses 格式并适配 Codex。做 AI 工具链整合和自动化工作流的可以直接接 API 测一周,看推理和 Agent 稳定性。

点击打开原文

Luma 与 Dumbstruck 推出广告创意智能方案

Luma 与广告科技公司 Dumbstruck 合作推出面向广告行业的 Creative Intelligence 方案,将 Luma 的视频生成能力与广告创意优化结合,面向品牌广告投放场景。对广告代理和商业短片团队来说,这是视频生成工具向广告投放链路延伸的信号,值得关注其后续开放的接口和案例。

Luma 把视频生成能力往广告投放场景延伸,做商业短片和广告代理的可以关注这套方案怎么把创意和投放数据打通。

点击打开原文

MiniMax Music 3 开源,已上线 ComfyUI

MiniMax 官方宣布 Music 3 模型开源,已支持本地 ComfyUI 运行,云端版本即将上线,Hugging Face 当天(day 0)接入托管。官方表态「将保持开源直到 AGI 到来」。对 AI 后期和配乐创作者来说,这意味着可本地部署的音乐生成能力,能直接嵌入现有 ComfyUI 工作流,批量生成配乐和音效的自动化链路更完整了。

MiniMax 把音乐生成模型也开源了,本地 ComfyUI 直接能跑,做 AI 配乐和音效的后期可以立刻上手试,云端版也快来了。

点击打开原文,能否访问取决于网络环境

DeepSeek 开源智能体框架 Harness v0.1 预览版

DeepSeek 发布 Harness v0.1 开发者预览版,MIT 许可证开源。该智能体框架基于 Cordis 元框架构建,核心设计为「一切皆插件」,模型、工具、技能、会话、沙箱、文件系统、循环、编排及 UI 均可自由组合、替换和扩展。对 AIGC 技术整合者来说,这是一个可深度定制的 Agent 编排底座,适合搭建批量生成、自动化剪辑与发布链路。

DeepSeek 开源了基于 Cordis 的智能体框架,核心是「一切皆插件」,模型、工具、会话、沙箱、UI 都能自由组合替换。做 AI 短剧自动化流水线的技术整合者可以拿来当底层框架,把生成、剪辑、发布串成一条链。

点击打开原文,能否访问取决于网络环境

Suno 发布 Studio 2.0,加入 MIDI 支持向专业 DAW 靠拢

Suno 发布 Studio 2.0,核心升级是加入 MIDI 支持,这是其用户呼声最高的功能,也是现代 DAW 的基础能力。整体定位从带生成功能的简易音频编辑器,向真正的数字音频工作站靠拢。

做 AI 配乐和后期混音的可以关注,MIDI 支持意味着生成结果能进专业编曲流程精修,不再只是出个成品音频。

点击打开原文

FLORAai:手绘草图生成写实服装

FLORAai 官方发布新品,主打从手绘草图直接生成写实服装效果图,强调面料质感与垂坠感还原。面向服装设计、视觉开发场景,可快速产出成衣预览。

做 AI 视觉和服装设计的可以点开看,从纸面草图直接出带面料和垂坠感的写实成衣,省掉建模和贴图环节。

点击打开原平台查看,能否访问取决于网络环境

工具与能力

Tools

官方介绍:Seedream 5.0 Pro 图层分离功能

BytePlus 官方介绍 Seedream 5.0 Pro 的图层分离功能,可将生成的图像拆分为独立可编辑图层,支持对单个元素进行移动、缩放、换色、替换或删除,同时保持画面其余部分不变。

生成图能拆成独立可编辑图层,移动、缩放、换色、替换、删除单个元素都不动其他部分,做视觉和短剧分镜的可以直接上手试,改图效率能提一档。该产品的发布我们已在 2026-07-09 报过,这条是官方对已有能力的介绍,不是新上线。

点击打开原平台查看,能否访问取决于网络环境

OpenAI 预览 Ultrafast 模式:GPT-5.6 Sol 提速 14 倍

OpenAI 预览 Ultrafast 模式,这是新的 API 服务层级,由 Cerebras 提供算力,将 GPT-5.6 Sol 运行速度提升至最高 14 倍,输出速率达每秒 750 tokens。对 AIGC 技术整合者来说,这意味着批量媒体处理、自动化剪辑、实时字幕等创作流水线的吞吐上限大幅提升,值得接 API 跑一周验证实际延迟和成本。

OpenAI 官方 API 新服务层级,GPT-5.6 Sol 提速 14 倍、每秒 750 tokens,做自动化剪辑、批量生成、实时字幕的后期和整合者可以接 API 实测吞吐。

点击打开原平台查看,能否访问取决于网络环境

Runway 上线 Scene Fixer:AI 精准修复片段不一致

Runway 推出 Scene Fixer 功能,针对 AI 生成片段间不一致问题。用户将序列导入后,视觉 AI 自动标记出服装、道具、灯光、视线等穿帮点,确认后 Aleph 模型只修复指定区域,其余画面保持帧级一致,音频不受影响,避免整段重roll。

做 AI 短剧和长片的痛点就是片段间穿帮,Scene Fixer 能只修问题帧、其余保持原样,不用整段重roll,值得接进工作流实测。

点击打开原平台查看,能否访问取决于网络环境

Codex 与 ChatGPT 新增近期工作上下文理解

OpenAI 官方宣布 Codex 和 ChatGPT 新增「计算机历史记录」(Computer History)功能,用户选择加入后,模型可理解近期工作上下文,接续之前的工作、理解工作模式,并针对重复性工作推荐技能或定时任务。该功能面向提升 AI 代理的连续工作能力,对依赖 Codex 进行批量媒体处理、自动化剪辑与发布链路编排的技术整合者有直接价值,可减少重复指令、提升长任务稳定性。

OpenAI 给 Codex 和 ChatGPT 加了「计算机历史记录」开关,能记住你近期的工作上下文、接续之前的活。做自动化剪辑、批量生成管线的技术整合者可以开起来试试,看它能不能减少重复沟通成本。

点击打开原平台查看,能否访问取决于网络环境

Gemini 3.7 Flash 登陆 Cursor 编辑器

Google 的 Gemini 3.7 Flash 模型现已集成到 Cursor 编辑器中,用户可直接选用。发布方为 Cursor 相关账号,并附带了内部评估的部分结果截图。对 AIGC 创作者而言,这意味着在 Cursor 里做自动化脚本、批量媒体处理或工作流编排时多了一个可选的底层模型,具体效果需在编辑器内实测。

Cursor 用户可以直接在编辑器里切到 Gemini 3.7 Flash 跑代码生成和重构,做 AI 短剧工具链整合的可以实测一下它在批量脚本处理上的表现。

点击打开原文,能否访问取决于网络环境

HeyGen LiveAvatar 原生接入 Cartesia 语音

HeyGen 宣布 Cartesia 语音原生集成至 LiveAvatar,已构建的语音 Agent 无需重建即可实时驱动数字人面部对话。对做虚拟角色、AI 短剧和实时互动内容的团队来说,省掉了语音与口型对齐的中间层,可直接接 API 测试效果。

做虚拟角色对话和 AI 短剧的可以试:已有 Cartesia 语音 Agent 不用重建,直接给 LiveAvatar 数字人套上脸,实时对话。

点击打开原文,能否访问取决于网络环境

VEED 上线多镜头角色功能,多机位 AI 视频

VEED 官方宣布推出多镜头角色功能,支持用多个摄像机角度创建 AI 视频,官方宣称可节省数小时编辑时间、提升观众观看时长,并带来 10 倍更真实的效果。前 200 名转发并评论「VEED」的用户可获赠 500 AI 积分。

VEED 官方宣布多镜头角色功能,用多个摄像机角度生成 AI 视频,主打省编辑时间和更真实效果。做 AI 短剧和口播视频的可以上手试一下多机位切换的成片质感。

点击打开原平台查看,能否访问取决于网络环境

Grok 4.6 上线 OpenCode 可试用

xAI 官方宣布 Grok 4.6 模型可在 OpenCode 中试用。OpenCode 是 AI 编程工具,接入新模型后,创作者可将其用于自动化脚本、批量媒体处理等创作流水线环节。具体能力细节和性能参数未在推文中展开。

Grok 4.6 进了 OpenCode,做 AI 编程/Agent 工作流的可以接进创作流水线试试,看它写脚本和批处理的能力稳不稳。

Google Sheets 上线 Canvas 画布功能

Google AI Blog 官方发布 Sheets canvas 功能演示视频,展示将电子表格数据转化为可视化画布呈现的能力。该功能面向数据展示场景,与 AI 影视创作工作流关联度较低,属于办公效率类更新。

Google 官方演示 Sheets 画布功能,把表格数据可视化呈现。对创作者工作流影响有限,做数据整理和项目排期的可以顺手看一眼。

点击打开原文

方法与经验

Methods

Google Flow 官方教程:3 种方式用 Gemini Omni 改视频

Google Flow 官方发布教程,演示在 Flow 中用 Gemini Omni 转换视频的 3 种方式:添加(道具)、修改(季节/颜色)、移除(背景人群),核心卖点是编辑过程中保持角色表演完整。教程以视频分解形式呈现,由 AI 生成。

官方出的 Omni 视频编辑教程,加道具、换季节、擦人群都能保住角色表演,做短剧和视觉的可以直接照着跑一遍工作流。

点击打开原平台查看,能否访问取决于网络环境

官方指南:可灵 Image 3.0 Omni,原生 4K 与图像系列生成

可灵官方放出 Image 3.0 Omni 的使用指南(该模型此前已发布,不是新上线):讲原生 4K 输出与「图像系列」模式怎么用,以及在统一多模态框架下怎么保住皮肤透光、花卉色彩、叶片层次这类材质细节,减少数字感与伪影。

官方出的 Omni 使用指南,不是新发布。视觉师和美术总设可以照着调 4K 出图和系列一致性,省得自己一个参数一个参数试。

点击打开原文

MiniMax-Music3 Gradio 工作流上线

AK(@_akhaliq)发布 MiniMax-Music3 的 Gradio 工作流,托管在 Hugging Face Spaces,可直接在线使用或部署。对 AI 后期和配乐创作者来说,这是一个开箱即用的音乐生成工具链,能快速接入现有工作流。

做 AI 配乐和后期音效的可以直接拉这个 Gradio 工作流跑一遍,省去自己搭环境的功夫。

点击打开原文,能否访问取决于网络环境

PixVerse 拆解《Not With Me》Seedance 2.5 表演细节

PixVerse 官方拆解 AI 短片《Not With Me》的 Seedance 2.5 工作流:通过锁定夫妻正反打镜头保持角色一致性,用自然英语对白(含打断、停顿、重话前的呼吸)提升真实感,并强调微表演——下颌收紧、话语落地前眼眶湿润、重心偏移等细节来驱动情绪。

官方拆解短片《Not With Me》如何用 Seedance 2.5 锁住夫妻正反打、自然英语对白和微表情表演,做 AI 短剧和剧情片的可以直接抄这套镜头与表演控制思路。

OpenAI 官方指南:用 GPT-5.6 构建高效 AI Agent

OpenAI 官方博客发布《The builder's guide to GPT-5.6》,面向开发者讲解如何利用 GPT-5.6 构建更快、更省成本的 AI Agent,核心内容包括更智能的模型选择策略,以及新版 Responses API 带来的新能力。

OpenAI 官方出的构建指南,讲怎么用 GPT-5.6 和新的 Responses API 做更省成本的 AI Agent。做自动化剪辑、批量生成、发布链路的整合者可以当官方参考读一遍。

Luma 官方图像提示词指南:精准控制画面

Luma AI 官方博客发布图像提示词指南,主题为「如何精准获得你想要的画面」。内容聚焦于提示词的结构化写法,帮助创作者在 AI 图像生成中更精确地控制构图、光线、风格等画面要素。

Luma 官方出的提示词方法论,视觉师和编导可以当模板收藏,套用它的结构去写分镜描述,出图可控性会高不少。

点击打开原文

PixVerse 拆解广告级镜头:4 参考锁定+35mm 胶片调色

PixVerse 官方账号发布一条广告级 AI 视频的构建思路:锁定 4 个参考(女主角、戒指、1968 款野马、海边小镇),采用 35mm 胶片质感,金色时刻光线、低饱和奢华色调、柔和光晕。镜头语言上,从后视镜中女主角的眼睛缓慢推近,再长距离拉远至航拍视角,全程无 Logo。

官方号直接给了一套广告级分镜思路:4 个参考锁定角色和场景,35mm 胶片调色定质感,镜头语言用后视镜推近再拉远做叙事。做品牌片和短剧的可以直接抄这套镜头设计。

Claude 接管应用日常维护:数周自动开 388 个 PR

Boris Cherny 让 Claude 接管应用日常维护,通过 Slack 频道运行崩溃模糊测试、重复代码统一、死代码移除等任务,数周内自动开出 388 个 PR,其中 180 个经 Claude Code Review 和人工审核后合并。Claude 通常一次改对,出错时通过调整例程次日改进。对 AIGC 技术整合者来说,这套「AI 自主跑任务+人工审核」的例程化工作流,可借鉴到批量素材处理、自动化剪辑等创作链路的落地。

Claude 通过 Slack 跑日常维护任务,数周自动开 388 个 PR、180 个合并。做 AI 自动化工作流整合的可以拆解这套「例程+自动审核」的落地方式。

点击打开原文,能否访问取决于网络环境

Luma 官方发布 25 条视频广告 AI 提示词模板

Luma AI 官方博客发布 25 条面向视频广告场景的 AI 提示词模板,每条均为可直接套用的示例,覆盖广告片常见的叙事、风格、节奏等方向。对做广告片、短剧和商业视频的创作者来说,是现成的 prompt 素材库,可直接改写用于 Luma 及其他视频生成工具。

官方出的提示词模板合集,做广告片和短剧的可以直接套用改,省得自己从零调 prompt。

点击打开原文

Luma 官方发布 AI 视频提示词完整指南

Luma AI 官方博客发布《How to Write AI Video Prompts: The Complete Guide》,系统讲解 AI 视频提示词的撰写方法,覆盖结构、风格、镜头语言等维度。对创作者来说,这是一份官方视角的提示词方法论,适合作为入门参考或团队培训材料。

Luma 官方出的提示词教程,做 AI 视频的可以当基础手册翻一遍,适合刚上手的新人建立提示词框架。

点击打开原文

作品与案例

Works

Higgsfield 开源 20 分钟 AI 剧情片 ONEIRIC

Higgsfield 官方发布 AI 剧情片《ONEIRIC》,宣称 100% AI 制作,基于 Cinema Studio 4 完成,已开源并参与 100 万美元 Higgsfield 全球电影节。

AI 剧情长片,全程用 Cinema Studio 4 制作并开源,做 AI 短剧和长片的可以直接拉片看长叙事和视觉一致性怎么处理。

点击打开原平台查看,能否访问取决于网络环境

创作者用 Seedance 2.5 生成度假记忆短片

创作者 Jasmine 用 Seedance 2.5 生成一段度假记忆风格的短片,包含车站错误转弯、失败的节日游戏、随机笑话和小山顶时刻等生活流场景,强调非计划感的自然叙事。

个人创作者用 Seedance 2.5 生成的度假记忆风格短片,主打自然、非计划感的叙事节奏,做短剧和视觉的可以拉片看生活流场景的连贯性处理。

点击打开原平台查看,能否访问取决于网络环境

微信公众号 光影漫游AI 二维码
觉得日报有用的话,欢迎关注微信公众号,AI 影视创作的内容都在那里。
光影漫游AI
微信内长按二维码识别,或复制名称到微信搜索