← 全部日报

AIGC 信息日报

2026 年 7 月 25 日 周六

行业与平台

Industry

Claude Opus 5 发布,以一半价格逼近 Fable…

Anthropic 发布 Claude Opus 5,支持 100 万上下文,知识截止至 2026 年 5 月,已全量上线。ARC-AGI-3 得分 30.2%,接近 GPT-5.6 Sol(7.8%)的四倍;输入每百万 Token 5 美元、输出每百万 Token 25 美元,价格同 Opus 4.8,仅为 Fable 5 的一半。

Claude Opus 5 以一半价格达到 Fable 5 级别的性能,ARC-AGI-3 得分 30.2% 直逼 GPT-5.6 Sol。做 AI 剧本和 Agent 工具的团队直接接 API 测适配,成本可能降一半。

点击打开原文

We're releasing V8

Midjourney 发布 V8.2 模型并设为默认,改进集中在美学、个性化和图像质量,新风格更创意、大胆、锐利、新鲜,个性化效果显著增强。对 AI 视觉创作者,可直接更新体验新风格在概念图和角色设计中的表现;对影视前期团队,可评估其在风格参考和美术定调上的适用性。

Midjourney V8.2 今日上线并设为默认模型,美学和个性化显著提升,风格更锐利大胆。做视觉概念和角色设计的直接上手测风格表现,前期团队可当新参考工具。

点击打开原文,能否访问取决于网络环境

Wanna turn any song into a mus…

PixVerse 上线 VibeMV 功能,支持上传任意歌曲一键生成完整音乐视频,提供 15 种风格,具备角色一致性与唇同步歌词,无需拍摄或剪辑。官方同时推出关注转发获 150 积分的限时活动。

PixVerse 把音乐视频生成做成了一键工具,上传歌曲、选风格、出片,带角色一致性和唇同步。做 MV 和短视频的可以直接上手试,15 种风格覆盖主流调性,省掉拍摄和后期环节。

点击打开原平台查看,能否访问取决于网络环境

Higgsfield 超级计算机让 Claude 直接操作 …

Higgsfield 推出新“超级计算机”功能,通过 MCP 协议让 Claude 直接读取并修改 Adobe After Effects 实时项目,支持图层、关键帧、效果和表达式操作。用户描述任务后,Claude 自动编写 ExtendScript 或生成可编辑的表达式,所有操作在 Claude 内通过 Higgsfield MCP 执行。

后期团队可以躺平了:用自然语言让 Claude 直接改 AE 图层、关键帧和表达式,不用手动写脚本。做后期和技术整合的,现在就去试 Higgsfield MCP,看实际出片稳不稳。

点击打开原平台查看,能否访问取决于网络环境

Google 发布可微分 3D 头部模型 gmn,CPU 即…

Google 发布可微分 3D 头部模型 gmn,参数化设计,支持精细控制所有面部动作和表情,无需 GPU 在 CPU 上即可运行。模型已在 Hugging Face 提供交互式 demo,可微分特性使其能无缝接入神经网络训练,用于表情迁移、逆向渲染等任务。

Google 开源了一套可微分 3D 头部模型,所有面部动作和表情都能精细实时控制,CPU 就能跑通。搞角色动画、面部驱动或表情迁移的,直接上 HuggingFace 试交互 demo。

点击打开原平台查看,能否访问取决于网络环境

阿里云Qwen-Audio-3.0-TTS上线OpenRou…

阿里云发布Qwen-Audio-3.0-TTS模型,已上线OpenRouter平台,开发者可通过API直接调用,适用于AI配音、有声内容生成等场景,降低TTS部署门槛。

阿里云最新TTS模型上线OpenRouter,做AI配音和有声书的可以直接接API测一听,省掉本地部署的功夫。

蚂蚁百灵Ling-3.0-flash免费开放一周

蚂蚁百灵发布Ling-3.0-flash模型并免费开放一周,集成Hermes框架,支持记忆功能(保留对话上下文)。模型可用于文本生成、角色对话等创作辅助场景,免费期适合开发者测试效果和集成。

蚂蚁百灵Ling-3.0-flash免费开放一周,做AI编剧和对话系统的可以趁免费期跑测试,看看生成质量和记忆功能的表现。

点击打开原平台查看,能否访问取决于网络环境

阿里云Token计划整合多模型计费

阿里云推出Token计划,整合通义千问、Wan、HappyHorse、DeepSeek、GLM等模型计费,从按订阅付费改为按交付内容付费,首月起价4美元。对使用阿里云API的创作者(短剧、视觉、配音等)来说,成本结构更统一透明,可试算对比。

阿里云把通义千问、Wan等模型计费统一成Token积分池,首月4美元。做AI应用集成或自用API的可以算算成本降幅。

点击打开原平台查看,能否访问取决于网络环境

工具与能力

Tools

Real-time, playable worlds fro…

阿里巴巴云模型“Happy Oyster 1.0”在 fal 平台上线,同时推出 Realtime Playground,可从一句话实时生成可探索和交互的 3D 世界。支持第一/三人称视角冒险模式,实时移动与摄像机控制,世界随生成过程而被探索。

从一句话到可实时交互的 3D 世界,生成的同时就能进去逛。AI 虚拟制片和互动叙事的工具又进了一步,做游戏化短剧或场景探索的团队,直接去 fal 试玩一把。

点击打开原平台查看,能否访问取决于网络环境

Spaces,我们的氛围编码工具,用于构建任何自定义乐器或音…

Google Flow Music 旗下音乐创作工具 Spaces 迎来重大升级,现支持在应用内直接生成和编辑歌曲(翻唱、替换、扩展)以及音轨分离。无需跳转外部软件即可完成从合成到混音的全程操作,面向需要快速生成定制配乐或处理已有音频的创作场景。

Google Flow Music 的 Spaces 升级成一站式音乐工作站,能直接生成编辑歌曲和分离音轨。做 AI 短剧/视频配乐的可以把它嵌进音频管线,省掉来回切软件。

ChatGPT 桌面版语音功能上线

OpenAI联合创始人Greg Brockman在X上宣布ChatGPT桌面版语音功能上线,桌面应用新增语音交互能力,用户可直接通过桌面端进行语音输入和实时对话。

桌面版终于能直接用语音了,做配音和对话脚本生成可以边说话边出结果,后期和编导装起来实测语音流畅度和转写质量。

Google 向 Gemini Pro 用户推出 Spark…

Google 已向美国 Gemini Pro 用户推出 Spark Agent 功能,支持用户创建可执行多步骤任务的 AI agent。该功能两个月前已可尝试,现正式面向 Pro 用户开放,更多国家即将推出。

Google 在 Gemini Pro 里正式推出 Spark Agent,可以用它创建自定义 agent 来自动化执行任务,比如素材管理、文案生成。做 AI 工作流整合的可以接进创作管线试试。

点击打开原文,能否访问取决于网络环境

Hyper3D 自动拆解3D模型为独立零件

Hyper3D 推出 BANG to Parts 功能,可将完整 3D 模型自动拆解为多个独立零件,支持递归拆解(如整车→车轮→轮毂),拆解后的零件可直接用于动画、改材质或 3D 打印,每个零件可单独编辑或重新生成。适合 3D 美术师、动画师和模型师提升拆件效率。

Hyper3D 这个拆解功能挺实用,做3D动画和改材质的能省大量手动切模时间,递归拆解到零件级还支持3D打印,3D美术师直接装进工作流。

点击打开原平台查看,能否访问取决于网络环境

Claude Opus 5 is now available…

Perplexity 官方宣布在 Perplexity 平台和 Perplexity Computer 中集成 Claude Opus 5 模型。他们在 WANDR 基准上对六个模型进行了评估,结果显示 Claude Opus 5 的性能仅次于 Fable 5,但推理成本低 57%。创作者现可通过 Perplexity 使用该模型进行搜索、分析和内容生成。

Perplexity 接上了 Claude Opus 5,内部评测在 WANDR 上只输给 Fable 5,但价格便宜 57%。做 AI 内容调研和剧本策划的可以在 Perplexity 里直接用了,性价比不错。

点击打开原文,能否访问取决于网络环境

You can now teach LetzAI new t…

LetzAI 推出自定义 Skills 功能,用户可向 Chat 或 Canvas 添加自建技能模块,平台 Agent 会自动调用这些技能执行工作流中的任务,无需手动切换工具。具体添加方法见链接指南。

LetzAI 让用户自己写 Skills 塞进 Agent 工作流里,做 AI 工作流编排的不用再手动拼工具了,一个 Agent 串完所有步骤。

点击打开原平台查看,能否访问取决于网络环境

OpenRouter 上线 xAI Grok STT 服务

OpenRouter 宣布上线 xAI 的 Grok STT(语音转文本)模型服务,开发者可通过 OpenRouter API 直接调用,无需单独部署 xAI 模型。该服务现已开放,具体能力参数和定价需查阅官方文档。

OpenRouter 接入了 xAI 的 Grok 语音转文字模型,做后期字幕和语音转写的团队可以直接调 API 测试效果,省去自行部署的麻烦。

点击打开原文,能否访问取决于网络环境

OpenRouter 推出 Classifiers 测试版:…

OpenRouter 推出 Classifiers 测试版,允许用户通过自定义分类法(最多 8 个维度)自动标记每次 AI 请求的任务类型、部门归属、合规类别。分类异步运行不增加推理延迟,支持采样率控制成本,推荐使用 Gemini 3.5 Flash Lite 作为分类模型。标记结果写入日志,可在 Activity Explorer 中按维度聚合分析模型使用分布与成本流向。

OpenRouter 这个自动标记功能对同时调多个模型的团队挺实用,能按任务类型/部门自动分成本,不增加推理延迟,整合者接上就能用。

点击打开原文

SmolForge 新增自定义皮肤与动画功能

SmolForge 发布 4 项新功能,支持可自定义皮肤(换装/换色)和精灵图动画(帧序列编辑/过渡控制),由创始人 swyx 在 X 上预告,具体接口和用法需查看原文链接。

SmolForge 给角色和动画加了自定义皮肤,做独立游戏或动画短片的视觉师可以直接上手试,省掉重复调参的功夫。

点击打开原文,能否访问取决于网络环境

方法与经验

Methods

RT @HeyGenDev: HeyGen research…

HeyGen 官方发布研究更新,提出无需共同标注数据集的多行为虚拟人控制方法,可独立训练每种行为(如表情、手势等),并融合控制。当前为研究阶段,未公布具体产品化时间。

HeyGen 发了多行为虚拟人控制的研究,做 AI 角色和虚拟 IP 的可以盯着后续产品化,省去被多个数据集绑定的麻烦。

点击打开原平台查看,能否访问取决于网络环境

后悔知道晚了,通过我的 github 雷达发现一个宝藏仓库:…

GitHub 仓库 video-shotcraft 整理汇总了 106 个镜头配方、162 种风格、161 个动态预览,并将分镜、运镜、节奏、音效及 Remotion 实现封装成 Agent Skill,适合作为 AI 影视制作的镜头灵感库和自动化素材。

做视觉和短剧的可以拉一下这个仓库,106 个镜头配方直接当素材库用,还打包了 Remotion 实现和 Agent Skill,省掉自己试参数的时间。

点击打开原文,能否访问取决于网络环境

Claude Design 产品设计师 Nate Parro…

Anthropic 产品设计师 Nate Parrott 分享了在 Claude Design(beta)中利用 HTML 交互能力进行产品原型、幻灯片、动画等视觉创意探索的方法,并将 Anthropic 品牌规范提炼为提示词,使输出自动符合品牌指南。Claude Design 不含图像模型,不适合 Logo 设计,但可与 Claude Code 协同,将早期创意与生产开发衔接。

Claude Design 产品设计师亲自拆解如何用 HTML 交互做产品原型、动画和视觉探索,还把品牌规范写成提示词让输出自动对齐。做视觉/品牌设计的可以边看边试这套工作流。

点击打开原文

How Serviceplan MAKE Uses Luma…

Luma AI 官方博客发布客户案例,介绍创意机构 Serviceplan MAKE 如何将 Luma 视频生成工具融入广告创意流程,优先把精力放在创意本身而非技术门槛。案例展示了从概念到品牌成片的落地路径,涉及 AI 生成广告短片和视觉素材。

Luma 官博发了家创意机构的真实案例,做广告和品牌向 AI 内容的可以点开看看对方怎么把 AI 嵌进工作流,不啰嗦,值得两分钟翻一遍。

点击打开原文

SEA BEASTS Prehistoric nightma…

PixVerse 官方发布 15 秒 AI 短片《SEA BEASTS》,史前海怪题材,完全使用 PixVerse Canvas 功能生成,并公开了逐镜头(shot-by-shot)的 prompt 工作流。短片为 15 秒生存惊悚风格,展示了 Canvas 在分镜级控制下的出片效果。

PixVerse 官方用自家 Canvas 功能跑了个 15 秒史前海怪短片,并公开了逐镜头 prompt 工作流。做 AI 短片的可以直接套这个 shot-by-shot 流程测出片稳定性。

点击打开原平台查看,能否访问取决于网络环境

RT @helenyuanai: I made this e…

创作者 @helenyuanai 用 Gemini Pro 写脚本和提示词,结合 Lovart 平台,2 小时内完成一支油画风格 AI 视频。展示了从文本到成片的快速工作流,Lovart 负责视频生成环节。

个人创作者 2 小时出片,油画风格+AI 全流程,做视觉和编导的可以当工作流参考,看看 Lovart 的生成效果稳不稳。

点击打开原平台查看,能否访问取决于网络环境

两名工程师用AI 3.5个月完成FedEx平台重建

Limestone Digital 团队用 2 名工程师在 3.5 个月内重建了 FedEx 供应商的交付编排平台,原估计需 7-8 个月。首周未写代码,先构建覆盖模块、依赖、数据流和领域术语的全仓库知识图谱(markdown 文件),AI 智能体据此生成代码,最终约 90% 的代码由模型编写,122 个合并 PR 均经人工审查。AI 计算成本约每名开发者每月 200 美元。

AI 编程 Agent 的实战案例,2 人 3.5 个月干完 5 人 8 个月的活。做 AI 短剧/动画的团队可以看他们怎么用知识图谱让 Agent 理解项目全貌,这套思路套到创作管线里也能省掉大量沟通和返工成本。

皮克斯花了好几年时间制作这样的场景…… 仅用 3 个提示词在…

创作者 Abdul Șhakoor 展示用 Higgsfield AI 配合 Claude 技能,仅用 3 个提示词(角色表、生物表、视频提示)复刻皮克斯风格的飞行场景。工作流涉及 GPT Image 2 生成角色参考图,再通过 Higgsfield AI 生成视频片段。

用 Higgsfield AI 加 Claude 技能,3 个提示词复刻皮克斯级飞行场景。做 AI 短剧和视觉开发的可以拉一遍工作流,看角色表+生物表+视频提示怎么串。

点击打开原平台查看,能否访问取决于网络环境

generate your own here: https:…

推文分享一个自定义图像生成工作流:常规质量用 Grok Imagine + Gemini 组合,高质量输出则改用 GPT Image 2 + Seedance 2.0。推文附有链接指向具体生成页面。

一条工作流分享:用 Grok Imagine + Gemini 做常规图,GPT Image 2 + Seedance 2.0 出高质量图。做视觉和美术的可以收藏当 prompt 参考。

点击打开原文,能否访问取决于网络环境

作品与案例

Works

游戏CG导演耗时一个月!三角洲原创AI电影《废墟之上-GTI…

取材于游戏《三角洲行动》的原创AI电影,导演@Markpig008、制片@折腾5号,讲述GTI老兵Frank Mercer在阴谋与战争中的故事,耗时一个月完成。游戏CG导演跨界AI制作,战斗场景的节奏和角色面部一致性是看点。

游戏CG导演一月出片,战斗场景叙事和角色一致性做得扎实,AI短剧和视觉团队可以直接拉片当战斗分镜参考。

点击打开原平台查看

【第48版】如果“豆包”死掉你会怎样-【AI全民制作人】

【AI全民制作人】系列第48版,B站AI短片。设定在算法统治的近未来,72岁印象派画家莫奈坚持手绘、拒绝AI工具,因其妻卡米尔罕见病被医疗系统放弃、遗言被AI判定无医疗价值。军用机器人Kalos被指派为安保,却对绘画产生兴趣,两人因对卡米尔画像而交集。作品探讨AI与人性、艺术创作冲突。

B站AI短片新作,近未来莫奈与机器人Kalos的情感线完整,做AI短剧的可以拉片看叙事节奏和角色一致性处理。

点击打开原平台查看

多动症版甄嬛传3-阖宫觐见一家亲【AI全民制作人】

B站UP主泰裤辣C总发布AI制作恶搞短剧《多动症版甄嬛传3-阖宫觐见一家亲》,属系列第三集,标签“AI全民制作人”,位列B站影视杂谈分区热门。作品为AI生成影像,融合经典IP与恶搞风格。

AI 恶搞经典 IP 的短剧系列第三集,B 站热门。做 AI 短剧的可以拉片看角色一致性和快节奏搞笑风格的衔接,尤其适合想试水经典改编的团队。

点击打开原平台查看

微信公众号 光影漫游AI 二维码
觉得日报有用的话,欢迎关注微信公众号,AI 影视创作的内容都在那里。
光影漫游AI
微信内长按二维码识别,或复制名称到微信搜索