01
@elevenlabs
ElevenLabs 发布 Music v2.5 音乐生成模型,输入一段想法、音效或 loop 即可生成完整歌曲,支持长篇幅作曲、曲中风格切换、说唱、歌词以及母语级人声演唱。对短剧配乐、原创 BGM 和带唱段内容的后期团队来说,这是把音乐生成从片段拼接推进到整曲产出的更新。
从一段动机、音效或 loop 直接生成完整歌曲,支持长曲式、中途换曲风、说唱和人声,做短剧配乐和原创 BGM 的可以拿它跑一版试试。
点击打开原平台查看,能否访问取决于网络环境
02
@runwayml
Runway 官方宣布企业可授权使用其前沿模型权重,支持用自有数据微调、部署在自家基础设施上,并对产出内容商业化,同时提供白手套服务和 Forward Deployed Researchers 驻场支持。对想摆脱通用 API、把生成能力沉淀成自有资产的影视公司和短剧团队,这是一条自建模型能力的路径。
Runway 把自家前沿模型权重拿出来做企业授权,可拿自有数据微调、自托管、商业化,还配 Forward Deployed Researchers 驻场。做 AI 影视的公司和想自建生成能力的团队可以看看这条路。
点击打开原文,能否访问取决于网络环境
03
IT之家
工信部印发《人工智能+软件》专项行动实施方案:到 2028 年培育高水平智能编程工具和智能开发平台,推广覆盖 2 万家规模以上软件企业,组织实施 100 项智能化技改项目,打造 100 个智能体软件标杆应用,孵化 5 个以上优质开源项目;到 2030 年关键软件全面实现智能化升级。政策指向的是软件与智能体产业,与影视创作流程没有直接关系。
到 2028 年要覆盖 2 万家规上软件企业、打造 100 个智能体软件标杆应用,做 AI 工具链和智能体产品的团队可以对着这份指标看自己能不能进盘子。
04
Hacker News 热门
YuE2 项目页发布音乐生成模型 YuE2,以可编辑符号乐谱(ABC 记谱)为中间表示生成全曲音频,支持旋律、节奏、和弦的可视化与编辑,示例含 Industrial Hip Hop、Chamber Folk 等风格,可做旋律重映射(如 F 大调转 D 小调)。在 WildSongBench(192 prompts)的 SongBench 上,YuE2 best-of-8 得 6.9632,为 15 个设置中最高观测均值,Suno v5 同对比得 6.8721。
YuE2 用可编辑符号乐谱做中间层生成整曲,SongBench 6.9632 略高于 Suno v5 的 6.8721,做 AI 配乐和短剧 BGM 的可以拿它跑几首对比听感。
05
IT之家
小米发布并开源工业级目标说话人语音识别大模型 Xiaomi-CocktailASR-1,针对多人同时说话时识别率骤降的「鸡尾酒会」难题。模型采用全流程 LLM 架构,以目标说话人的一段参考音频作为声纹提示,在多人环境中只提取并转录目标用户语音,多个主流多说话人测试集上达到 SOTA;单人识别性能比肩标准 ASR,可拒识非目标说话人(目标不在场时输出空文本),并支持思维链推理模式给出可解释过程。代码已开源于 GitHub 与 HuggingFace。
多人同场时只转写指定说话人,目标不在场直接输出空文本,做访谈、群戏同期声和播客后期的可以拉下来跑一遍,看能不能省掉人工挑轨。
点击打开原文
06
@fal
fal 发布 H3 Max Camera Controls,号称全球最快的 3D 视频模型,能把单一视角画面在 3 秒内转成可导航的 3D 场景,并支持以度数设定水平与垂直相机角度,让镜头在场景中移动同时保持画面一致。适合做分镜预演、虚拟运镜和场景探索的创作者测试。
单张视角图 3 秒内变成可自由运镜的 3D 场景,还能按度数精确设定水平垂直机位角度,做分镜预演和虚拟拍摄的可以上手试运镜。
点击打开原平台查看,能否访问取决于网络环境
07
@higgsfield
Higgsfield AI 发布 ChatGPT 插件「Motion Designer」,可在 After Effects 中做动态设计:插件理解动画原理、能编写表达式,并在 AE 项目里保留上下文。官方称现在即可在 After Effects 中试用该插件。对做动效、包装和批量套版的后期来说,这类把 AI 直接嵌进 AE 工作流的工具,主要价值在减少手写表达式和重复调整的环节。
做后期的可以留意:这个插件能在 AE 里写表达式、理解动画原理并保留项目上下文,动效和批量套版环节能省不少手写代码的时间,装一个跑两周看顺不顺手。
点击打开原平台查看,能否访问取决于网络环境
08
@testingcatalog
ComicForge 推出一款 Web 应用,把文字故事转成完整漫画书:自动绘制每一页、设计封面,支持 29 种语言撰写全书。用户可从八种艺术风格中选择(欧洲漫画到日式漫画),上传照片可让人物面孔在整本书中保持一致,成品为 2 到 40 页,可导出 PDF 或 CBZ 文件。
八种画风可选、照片锁人物脸、2 到 40 页导出 PDF/CBZ,做漫画和分镜预演的可以拿自己的剧本跑一本试试。
点击打开原平台查看,能否访问取决于网络环境
09
MarkTechPost
Sakana AI 发布 Fugu 系列两款新模型 Fugu Max 与 Fugu Ultra v2,二者共用同一套调度架构,通过单一 OpenAI 兼容 API 在多个模型间路由任务:Fugu Max 追求每美元最佳产出,Fugu Ultra v2 面向高难度多步任务。两款模型今日已上线托管 API,无开放权重,且不在 EU/EEA 提供服务。Fugu 于 4 月进入 beta、6 月正式可用,7 月新增 Fugu-Cyber 与 Claude Code 接口。
Sakana 把「多模型路由」做成一个 OpenAI 兼容 API,Fugu Max 主打每美元产出、Ultra v2 主打多步硬任务,做批量生成调度的技术整合者可以接 API 测一周成本曲线。
点击打开原文,能否访问取决于网络环境
10
@LinearUncle
抖音作者 CHunye 的 AI 恐怖日剧《渡骸》,设定为日本打捞船从海底捞起一口中国古棺、唤醒僵尸,因画质逼真被部分观众误认为 Netflix 出品。据该推文称制作使用商汤 Seko AI 视频创作平台,具体为其中的 Seko 画布(无限画布)。做 AI 短剧的可以找原片看恐怖题材的画质与氛围处理。
抖音作者 CHunye 的 AI 恐怖日剧,画质逼真到被误认成 Netflix 出品,据说用商汤 Seko 画布做的。做 AI 短剧的可以找原片看画质和恐怖氛围怎么处理。
点击打开原文,能否访问取决于网络环境
01
@turingou
郭宇(@turingou)用 GPT-6 Astra 通过 MCP 操作达芬奇,把 2020 年四季岛旅行拍下的 479 段、约 90GB 素材剪成近 20 分钟的 4K 旅行电影,从整理素材到成片导出约半小时。原文未展开具体剪辑决策细节。对后期和剪辑团队来说,这是 AI 直接驱动专业剪辑软件跑完整流程的实操样本,值得照着试自己的素材库。
479 段 90GB 素材到 20 分钟 4K 成片只用半小时,靠 MCP 直接驱动达芬奇。后期和剪辑团队可以照着这个思路试自己的素材库。
点击打开原平台查看,能否访问取决于网络环境
02
@Magncsans
作者 @Magncsans 发布 10 分钟教程,讲用 GPT 6 Astra 配合 Blender 建白模,再结合 Seedance 2.5 生成电影级运镜和画面。内容覆盖白模要建到什么标准、如何结合白模写提示词、过程中的常见坑,以及 Blender 之外的其他白模玩法,视频中展示的白模和提示词全部公开分享。
10 分钟讲透白模该建到什么精度、怎么照着白模写提示词、哪些坑要绕,白模和提示词全部公开。做 AI 短片和分镜的可以照着跑一遍,运镜控制这块能省不少试错。
点击打开原平台查看,能否访问取决于网络环境
03
@dreamina_ai
Dreamina AI 邀请 Pwnisher Challenge 冠军、Dreamina 3D Reference 创意赛评审 @manuelpeterCGI 实测一条工作流:GPT-6 Astra 生成航天飞机 3D 模型,配合参考图生成发射台并放进 Blender 场景;在 Blender 里定机位和镜头运动,做一次 Viewport Render;再把这段渲染当参考视频喂给 Dreamina,配合参考图和详细提示词生成发射画面。作者称机位、节奏、画面观感全程可控,后续补拍其他机位也容易。
3D 建模、Blender 定机位、Seedance 2.5 出成片,三段串成一条流程,做科幻镜头和预演的可以照着跑一遍。
点击打开原平台查看,能否访问取决于网络环境
04
@topazlabs
Topaz Labs 官方分享日本导演 Aurora Aura 的案例:她指出 AI 生成视频在大画幅下的精细细节是弱项,用 Topaz Labs 的 Astra 2 放大模型处理后,影片达到球幕放映标准。据其描述,Astra 2 不只是减少模糊和噪点,还能补充细节。做 AI 影像后期、需要把成片放大到影院/球幕等大屏的团队可参考这条放大工作流。
AI 视频放大到球幕这种大画幅,细节和噪点是老大难。日本导演 Aurora Aura 用 Topaz Astra 2 把片子做到能上球幕放映,做后期和视觉的可以看看它怎么处理大尺寸下的细节。
点击打开原平台查看,能否访问取决于网络环境
05
@ViggleAI
Viggle AI 称 GPT-6 Astra 现已能生成可动画的高斯泼溅角色,并将其接入 PINOC MCP。仅凭描述角色与动作,就做出了一款 backrooms 风格、类似 Exit 8 的游戏。Astra 通过 PINOC 的免费预设动画和文本生成动画产出角色及全部动作,并自行编写循环与异常逻辑,几轮会话内完成整个项目。
高斯泼溅角色能直接带动画,还接进 PINOC MCP 自动写循环和异常逻辑,做 3D 角色和互动内容的可以看看这套流程怎么串的。
点击打开原文,能否访问取决于网络环境
06
Runway
艺术家 VOIDZ 在 Runway 访谈中介绍其约 95 秒纪实混合现实影片《Ends Meat》的制作过程,全片含 15 处超现实干预。他用 Seedance 2.0 扩展和修改真实拍摄的购物素材,让商品在画面中膨胀变形,隐喻生活成本压力。他表示过去这类片子受传统 3D 流程限制只能做 10-15 秒,完全用传统 VFX 可能需六个月到一年。
传统 VFX 要半年到一年的活,这次靠 Seedance 2.0 改实拍素材做出来了。做混合现实和超现实视觉的可以拉片看那 15 处干预怎么落地。
07
@heyglif
Glif 官方演示:用 Google Omni 1.1 加 Seedance 2.5 生成素材,再由 Glif agent 完成音乐卡点对齐和自动剪辑,全程不手动操作剪辑软件,创作者只负责给 agent 下导演指令。推文附了创建链接。对后期和剪辑岗来说,这是一条把「生成素材」和「按节奏剪好」串成一步的自动化流程参考。
Glif 的 agent 把卡点对齐和自动剪辑全包了,人只负责下指令,不用手动在剪辑软件里对拍子。做 MV、混剪、短剧片头的后期可以点进去跑一遍,看它卡点准不准。
点击打开原平台查看,能否访问取决于网络环境
08
@GoogleDeepMind
Google DeepMind 团队为纪录片《Love, Rendered》复原了一段从未被拍摄过的记忆:把修复后的档案照片与姿态控制模型配对,还原 Burt 和 Ethelle 两人的举止习惯与微表情,重现他们初次相遇那天的场景。这是把静态老照片转成有表演细节的动态影像的一次具体实践,涉及照片修复、姿态驱动和表情还原几个环节。做历史纪录片、老照片活化、档案影像复原的后期和视觉团队可以看这套流程怎么串。
纪录片《Love, Rendered》里,团队把修复后的档案照片配上姿态控制模型,还原 Burt 和 Ethelle 初遇那天的神态和微表情。做历史题材、老照片活化、纪录片复原段落的后期和视觉可以拉片看这套做法。
点击打开原平台查看,能否访问取决于网络环境
09
@ZHO_ZHO_ZHO
X 用户 ZHO(@ZHO_ZHO_ZHO)实测 GPT Images 2.5 的人物特征保持能力:连续生成约 5 次后开始丢失人物特征,多人物场景尤为明显,噪点问题也随之加重,作者以第二次与第五次生成结果对比展示退化过程。做角色一致性和多人物分镜的视觉师、短剧团队可据此判断多轮迭代的安全轮次。
做角色一致性的视觉师和短剧团队可以看这份实测:连续生成约 5 次后人物特征开始丢,多人物场景和噪点问题更明显,作者用第二次和第五次结果做了对比。
点击打开原文,能否访问取决于网络环境
10
@maxescu
音乐创作者 Alex Patrascu 用 10 组新提示词、相同剪辑片段对比 Suno V6 与 Lyria 3.5。他认为 Suno V6 相对前代是退步,仍有金属音色,写歌和抓耳副歌能力强,但对子流派理解变差、风格糊成单一氛围,多样性不如旧模型,每条提示词听感雷同。Lyria 3.5 进步明显,乐器分离度和频谱空间感好,成曲更像真实歌曲,但命中率约一半,需要多次重试。ElevenMusic V2 因额度用尽未参与本轮测试。
同一批剪辑片段、10 组新提示词横评 Suno V6 和 Lyria 3.5,作者直言 V6 是退步、金属味重、子流派糊成一团,Lyria 乐器分离度好但命中率只有一半。做配乐和短剧声音的可以拿这份听感清单当选型参考。
点击打开原平台查看,能否访问取决于网络环境