← 全部日报

AIGC 信息日报

2026 年 8 月 27 日 周四

行业与平台

Industry

Google 发布 Gemini 3.5 Transcribe 语音转写模型

Google 发布 Gemini 3.5 Transcribe,官方称其最精准的语音转文本模型,支持 85+ 语言转写,能自动去除“um”“ah”等填充词,处理自我纠正并捕捉说话者意图,已开放使用。对后期和字幕团队来说,多语言转写和自动清理口头语能直接提升字幕制作与采访整理效率。

做后期和字幕的可以接 API 试一周,85+ 语言转写、自动去口头禅,字幕和采访整理能省不少事。

点击打开原平台查看,能否访问取决于网络环境

阿里云发布 Qwen3.8-Flash 多模态 MoE 模型

阿里云发布 Qwen3.8-Flash,多模态 MoE 模型,Qwen4 架构早期预览,权重已开放。125B 参数,每 token 仅激活 6B,训练成本为 Qwen3.7-Plus 的 1/9,性能全面超越后者。API 定价每百万输入 token 0.16 美元、输出 0.47 美元,原生支持 262K 上下文,可扩展至 1M。对创作者来说,这是目前性价比极高的多模态模型选项,尤其适合需要处理长文本和批量生成内容的场景。

阿里云开源 Qwen3.8-Flash,125B 参数但每 token 只激活 6B,训练成本是 Qwen3.7-Plus 的九分之一,API 价格也压到百万 token 输入 0.16 美元。做 AI 短剧和批量内容生产的团队可以接 API 测一周,看这个成本能不能把单集制作费再往下打。

点击打开原文,能否访问取决于网络环境

智谱开源 GLM-5.3-Flash,定价为 Opus 4.8 的 1/40

智谱上线并开源 GLM-5.3-Flash(320B-A18B),GLM-5 系列首个原生多模态模型,AA 综合智能指数 57 分,与 Claude Opus 4.8 持平。定价为 GLM-5.3 的 1/10,限时折扣内为 Opus 4.8 的 1/40,已接入 ZCode 等平台开放 API 调用。采用稀疏注意力与线性注意力混合架构,推理服务跑在国产芯片集群上。对创作者来说,这是把多模态能力成本打下来的信号,做批量生成和自动化流程的团队值得关注价格和 API 接入方式。

智谱把 320B 总参数的多模态模型开源,AA 指数 57 分对齐 Opus 4.8,价格却只有 1/40。做 AI 短剧和批量生产的团队可以接 API 测一周,成本压力能小一大截。

点击打开原文,能否访问取决于网络环境

Claude in Chrome 全面开放,浏览器自主操作免审批

Anthropic 宣布 Claude in Chrome 面向所有付费 Claude 套餐全面开放,Claude 可在浏览器中自主执行操作,无需逐步审批。系统通过安全分类器在每次操作前验证安全性及是否符合用户请求,并强化了针对提示注入攻击的防御。最新评测显示,在启用探测与安全分类器后,自 Opus 4.8 起的所有模型均未出现攻击成功案例。对 AIGC 技术整合者来说,这意味着浏览器内的自动化操作流程可以更顺畅地接入创作流程,减少人工干预。

Anthropic 把 Claude 塞进浏览器,能自主点页面、填表单、跑流程,不用一步步审批。做自动化工作流的整合者可以接上试试,把素材抓取、批量处理这类重复活交给它。

点击打开原文

Qwen 125B 模型本地运行仅需 75GB 内存

阿里 Qwen 官方宣布其 125B 参数模型可在仅 75GB 内存的本地环境运行,并感谢 UnslothAI 提供首发支持。该消息主要面向本地部署与推理优化场景,对依赖云端 API 的常规 AI 影视创作流程无直接影响,但为需要本地化、私有化处理素材的团队提供了新的硬件可行性参考。

Qwen 官方宣布 125B 大模型本地跑只需 75GB 内存,Unsloth 当天就做了适配。做本地化工具链和私有化部署的技术整合者可以关注,对纯创作流程影响不大。

点击打开原文,能否访问取决于网络环境

阿里云发布 QwenWork 一站式职场 AI 智能体平台

阿里云官方发布 QwenWork,定位一站式职场 AI 智能体平台,主打用先进 AI 模型和智能体能力提升生产力,已开放订阅。面向通用办公场景,非影视创作专用工具。对 AIGC 创作者来说,其价值在于潜在的批量处理与自动化调度能力,可关注后续 API 开放情况,评估能否接入现有创作工作流。

阿里云把 Qwen 模型和智能体能力打包成职场生产力平台,做 AIGC 工具链整合的可以关注它后续开放的 API 和自动化能力,看能不能接进自己的批量制作流程。

点击打开原文,能否访问取决于网络环境

MiniMax H3 亮相 RaySummit,33B 开源模型引关注

MiniMax H3 在旧金山 RaySummit 亮相,官方将介绍其 33B 开源音频-视频模型,该模型将文本、图像、视频和音频统一到一个上下文中。同时分享开发者如何微调、评估该模型。

MiniMax H3 在 RaySummit 上被重点介绍,33B 开源多模态模型把文本、图像、视频、音频放进一个上下文,做多模态工作流的可以关注后续开源细节。

点击打开原文,能否访问取决于网络环境

Topview 推 Motion Studio:Seedance 2.5 驱动动态图形

TopviewAI 推出 Motion Studio,由 Seedance 2.5 驱动,主打无需时间线、无需关键帧、无需动态设计师,上传参考图、描述想法、选风格即可在几分钟内生成动态图形视频,定位低成本替代传统 After Effects 项目。

做动态图形和视觉包装的可以试试,上传参考图、描述想法、选风格就能出片,省掉时间线和关键帧,适合批量出片和预算有限的团队。

点击打开原平台查看,能否访问取决于网络环境

工具与能力

Tools

Higgsfield 上线 Relight:拍完可拖拽补光调色

Higgsfield 推出 Relight 功能,可在拍摄完成后为任意镜头添加专业灯光:从任意角度拖拽光源、逐灯设置颜色与亮度、整体改变场景情绪氛围,现已上线可用。

拍完还能拖灯改色,后期和视觉师能省不少重拍功夫,做短剧补光救场的可以上手试。

点击打开原平台查看,能否访问取决于网络环境

Claude Cowork 新增内置浏览器,可自动填表完成任务

Claude 官方宣布 Cowork 新增内置浏览器功能:当任务涉及网站时,浏览器会在 Cowork 侧边面板打开,Claude 可自动导航、填写表单并完成工作。该功能面向需要与网页交互的自动化任务场景,属于 Cowork 工作流能力的扩展。

Claude 的 Cowork 里多了个内置浏览器,涉及网站的任务能自动导航、填表、跑完流程。做 AI 工作流整合的可以接上试试,看能不能把素材抓取、表单提交这类杂活自动化。

点击打开原平台查看,能否访问取决于网络环境

Recraft V4 Styles Pro 上线 2K 输出

Recraft V4 Styles Pro 新增 2K 光栅输出能力,面向印刷物料、大幅面应用和最终成片生产,提供更高的细节密度。该功能已通过 OpenRouter 平台开放,视觉师和后期团队可直接调用 API 接入现有工作流,用于海报、KV 等高质量静态视觉产出。

做视觉和海报的可以关注,2K 光栅输出对印刷和大幅面应用是实打实的升级,出图细节密度更高,适合直接接进成片物料生产流程。

点击打开原文,能否访问取决于网络环境

Perplexity 推出自进化记忆系统 Brain

Perplexity 发布 Brain,为其 Perplexity Computer 产品打造的自进化记忆系统。该系统能将会话、文件和资料源自动编译成结构化的知识 wiki。官方评测显示,新系统在初始结果基础上,正确性提升 9.3 个点,时效性提升 8.0,召回率提升 8.9,同时 token 消耗减少 15%。

Perplexity 给自家电脑助手加了自进化记忆系统,能把会话、文件、资料自动整理成知识库,正确率提升 9.3 个点。做 AI 工具链整合的可以看看这套记忆机制能不能接进自己的创作工作流。

点击打开原文,能否访问取决于网络环境

ChatCut 新增声音克隆与多语言口型匹配

ChatCut 官方宣布新增多项功能:克隆声音修正台词无需重拍、翻译配音并自动匹配口型、批量编辑和翻译字幕、移除背景、用一张图片创建 AI 数字人。定位是让单条视频素材扩展到多平台、多格式、多语言和多受众。

做后期和短剧的可以看看:单条素材克隆声音改台词、翻译配音自动对口型、批量字幕,省掉重拍和重剪的功夫。

点击打开原文,能否访问取决于网络环境

GLM-5.3-Flash 上线 OpenCode Go 限时双倍用量

OpenCode 官方宣布 GLM-5.3-Flash(原 Ox Alpha)已在 OpenCode Go 上线,并限时提供双倍用量。对做 AI 编程和自动化工作流的创作者来说,这是编程工具接入新模型并给额度优惠,适合跑批量生成或媒体处理类任务时薅额度。

OpenCode Go 接入了 GLM-5.3-Flash 还限时双倍用量,做 AI 编程和自动化工作流的可以顺手薅一波额度,跑批量任务划算。

腾讯 WorkBuddy 接入 Canva,一句话生成设计

腾讯 WorkBuddy 官方宣布接入 Canva,用户可通过自然语言指令直接完成演示文稿制作、帖子尺寸调整、品牌素材库调用等设计任务,无需在多个标签页间切换。该集成将 Canva 的设计能力纳入 WorkBuddy 的 AI 工作流,面向需要批量处理视觉物料的场景。

做视觉物料和海报的可以试试,把 Canva 接进 WorkBuddy 后,改尺寸、调品牌素材这类重复活能直接语音/文字指派,省掉来回切标签页。

点击打开原文,能否访问取决于网络环境

Gemini 聊天内一键生成 3D 交互可视化

Google 官方宣布 Gemini App 新增能力:在聊天对话中直接将问题或复杂主题转化为自定义的交互式 3D 可视化,支持旋转分子、模拟复杂物理系统等场景,仅需一条 prompt 即可生成 3D 模拟。该功能面向通用问答与科学演示场景,非影视创作专用。

Google 官方宣布 Gemini 能在聊天里直接生成 3D 交互可视化,一条 prompt 就能旋转分子或模拟物理系统。做视觉预演和分镜的可以试试,看能不能当快速概念草图用。

点击打开原平台查看,能否访问取决于网络环境

Grok Bot 向所有订阅用户开放,增长超预期

Grok Bot 现已向所有标准 Grok 或 Cursor 订阅用户开放,增长速度超过以往任何产品。用户已将其用于运营小型电商、协调客户活动、测试生产软件及处理日常繁琐工作。所有 SuperGrok 和 Cursor Pro 订阅者均可使用,每周使用限制已重置。

Grok Bot 全面开放给标准 Grok 和 Cursor 订阅用户,增长超预期。做 AI 短剧或内容生产的可以看看它能否接入自己的自动化流程,处理日常繁琐工作。

点击打开原文,能否访问取决于网络环境

Remotion Studio 接入 WebMCP,代理可读取选区

Remotion Studio 官方宣布现已实现 WebMCP 协议,代理(Agent)可以查看用户在编辑器中的选区(selection),并基于此上下文采取更具语境的操作。该更新面向自动化剪辑与程序化视频生成工作流,让 AI 代理能理解当前编辑状态而非盲目执行指令。

做自动化剪辑工作流的可以关注,代理能看懂你选中的片段再动手,等于给批量出片流程加了个上下文感知的入口。

点击打开原平台查看,能否访问取决于网络环境

FLORA 升级:实时调用 Agent 构建资产与工作流

FLORA 官方宣布升级,让用户能更便捷地在平台内使用自己的 Agent,实时构建资产、技术与工作流,并与常用工具协同。

做工具链整合的可以点开看,FLORA 把 Agent 调用做进实时创作流程,适合搭自动化出图出片工作流的人参考。

点击打开原平台查看,能否访问取决于网络环境

方法与经验

Methods

AI BORDER 实测 Wan3.0 单提示词出片全流程

阿里云官方账号转发 AI BORDER 对 Wan3.0 的完整上手实测:单条提示词、单次生成,全程在镜头前拆解从提示词到成片的完整结果。视频含全流程讲解,适合作为 Wan3.0 实际出片效果和操作流程的第三方参考。

第三方把 Wan3.0 从一条提示词到完整成片跑了一遍,全程对着镜头拆解。做 AI 视频的可以跟着看一遍真实出片流程和效果,比官方宣传片有参考价值。

点击打开原文,能否访问取决于网络环境

Minimax H3 日式文艺短片工作流:分镜提示词全公开

作者用 Minimax H3 制作 45 秒日式文艺短片,工作流为:一张角色场景图+画面描述提示词+风格提示词,每次生成 15 秒片段后拼接,关键道具或人物细节截图作为后续视频参考物料。剪辑时裁切问题画面,部分画面调速营造氛围感。完整提示词公开,含基础设定、日式青春文艺电影风格要求(自然光与空气感布光、高光过曝柔化边缘、克制慢镜头),以及按时间轴拆分的 6 个分镜场景(含焦段、景深、运镜、日语旁白)。

作者把 45 秒日式文艺短片的完整工作流拆开了:一张角色图+分镜提示词,每次生成 15 秒再拼接,关键道具截图做参考。做短剧和文艺向的可以直接抄这套提示词结构。

点击打开原平台查看,能否访问取决于网络环境

Wan3.0 发布广告全拆解:概念、角色表与失败生成

阿里 Wan 官方账号拆解 Wan3.0 发布广告的完整流程,涵盖概念设定、角色表、提示词,以及失败生成案例。内容详实,包含大量工作流技巧,面向使用 Wan3.0 制作视频的创作者,提供从创意到成片的可复用方法论。(该产品 8 月 7 日已发布)

官方拆解自家发布广告的完整工作流,从概念到角色表到提示词,连失败生成都复盘了。用 Wan3.0 做短剧和视觉开发的可以当模板抄,省掉自己踩坑。

点击打开原文,能否访问取决于网络环境

Magnific 演示单提示词生成可读文字

Magnific 官方演示:单条提示词、15 秒生成画面内可读文字,无需后期添加。具体工作流细节在链接线程中。

做视觉和后期的一键生成可读文字,省掉后期加字,值得点开看工作流。

点击打开原平台查看,能否访问取决于网络环境

Magnific 分享定格动画质感提示词技巧

Magnific 官方分享用提示词实现定格动画质感而非顺滑 3D 的方法:明确指定材质(毛毡、羊毛、金属丝骨架),要求 12fps 的顿挫感而非流畅运动,主动加入指纹、接缝、松散纤维等瑕疵,并保持场景小巧、灯光实用。

做 AI 动画和视觉的可以直接抄这四条 prompt 思路,想要定格质感而不是顺滑 3D 的,照着调材质名和帧率就行。

Magnific 展示 MiniMax H3 Max 单提示词成片

Magnific 官方账号发布一段 15 秒 AI 生成视频:一个不存在的拳击手在从未存在过的健身房里训练。全程仅用一条提示词从零生成,官方称可直接从该推文线程中获取完整 prompt。视频使用 MiniMax H3 Max 模型生成,并经过 Magnific 平台处理。

官方账号放出的单提示词成片 demo,附完整 prompt 可抄,做 AI 短剧和视觉的可以顺手收藏当模板。

点击打开原平台查看,能否访问取决于网络环境

Seedance 2.5 制作 30 秒日本旅行 AI 短片

创作者 @MayorKingAI 用 Seedance 2.5 在 Dreamina 上制作了一支 30 秒日本旅行 vlog,1080p 分辨率,全片 AI 生成,并附带了生成 prompt。属于个人创作者展示单一工具链完成短片制作的案例,重点在旅行题材的镜头语言与场景连贯性处理。

30 秒旅行 vlog 全用 Seedance 2.5 生成,1080p 出片,附了 prompt。做旅行类 AI 短片的可以拉片看镜头连贯性和场景切换,顺手把 prompt 抄走当模板。

点击打开原平台查看,能否访问取决于网络环境

创作者分享 H3 Max 起止帧拼接工作流

创作者 Ozan Sihay 用图像到视频的起始-结束帧方法生成 4 段各 15 秒视频,在 Premiere Pro 中用 Morph Cut 连接,叠加颜色、光晕和颗粒效果,再用 Topaz 提升至 1080p 和 60fps。所有输出均为首次生成,未做精细调整,仅用于测试该工作流。另预告其关于 @fal 修改版 Minimax H3 Max 的详细 YouTube 视频将于明天发布。

一条完整的起止帧拼接工作流:4 段 15 秒视频用 Morph Cut 衔接,再叠颜色、光晕、颗粒,最后 Topaz 拉到 1080p 60fps。做 AI 短剧和长叙事拼接的后期可以照着跑一遍,重点是看拼接缝怎么藏。

点击打开原平台查看,能否访问取决于网络环境

作品与案例

Works

Pika 用 WAN 3.0 生成玻璃电梯 30 秒长镜头

Pika 官方账号发布一段由 WAN 3.0 生成的 30 秒连续镜头:玻璃电梯上升过程中,多个沉浸式场景被无缝衔接进同一段运动。展示的是单镜头内场景连续转换的能力,对长镜头叙事和空间连贯性有参考价值。

Pika 官方用 WAN 3.0 跑的一段 30 秒连续长镜头,电梯上升串起多个场景,做 AI 短剧的可以拉片看长镜头叙事和场景衔接怎么处理。

点击打开原平台查看,能否访问取决于网络环境

AI 原创改编郑和下西洋,历史奇幻预告片

B 站 UP 主「下西洋」发布 AI 原创改编作品《中国人有自己的〈奥德赛〉》,以郑和下西洋为背景的历史奇幻题材预告片,定位「预告即正片」,主打海上历险与朝堂际遇的想象性改编,非严谨正史。

历史奇幻题材的 AI 预告片,把郑和下西洋拍成中国版《奥德赛》,做 AI 短剧的可以拉片看历史题材的视觉风格和叙事节奏处理。

点击打开原平台查看

Magnific 演示 MiniMax H3 MAX 12 秒生成全片

Magnific 发布一条 AI 短片 demo,画面、旁白、配乐在 12 秒内一次性生成,展示 MiniMax H3 MAX 模型的全片生成能力。同时宣布该模型在 Magnific 平台限时 48 小时无限量使用。

一条 12 秒生成的完整短片 demo,画面、旁白、配乐一次出,做 AI 短剧的可以看看全片生成的质量上限在哪。

点击打开原平台查看,能否访问取决于网络环境

微信公众号 光影漫游AI 二维码
觉得日报有用的话,欢迎关注微信公众号,AI 影视创作的内容都在那里。
光影漫游AI
微信内长按二维码识别,或复制名称到微信搜索