腾讯混元开源 AuK:语音生成与编辑统一模型
腾讯混元发布开源基础模型 AuK,主打语音生成与编辑统一:支持自然语言指令加参考音频的单一交互方式,覆盖零样本 TTS、指令控制生成、内容编辑、耳语转换四类能力,官方称其为「音频版 Nano Banana」。做 AI 配音、短剧对白和声音后期的团队可直接接入测试。
腾讯混元开源 AuK,一个模型把零样本配音、指令控声、内容编辑、耳语转换全包了,做 AI 配音和短剧声音后期的可以拉下来跑一遍。
点击打开原平台查看,能否访问取决于网络环境
腾讯混元发布开源基础模型 AuK,主打语音生成与编辑统一:支持自然语言指令加参考音频的单一交互方式,覆盖零样本 TTS、指令控制生成、内容编辑、耳语转换四类能力,官方称其为「音频版 Nano Banana」。做 AI 配音、短剧对白和声音后期的团队可直接接入测试。
腾讯混元开源 AuK,一个模型把零样本配音、指令控声、内容编辑、耳语转换全包了,做 AI 配音和短剧声音后期的可以拉下来跑一遍。
点击打开原平台查看,能否访问取决于网络环境
Suno 官方介绍 v6 音乐生成模型(该产品 9 月 10 日已发布),支持把图片、视频、语音备忘录转成音乐,可对已生成的歌曲做精细修改,并新增 v6-wild 分支探索更多风格可能。官方附了一段 2 分钟内的功能演示视频。对短剧配乐、后期声音和需要快速出 BGM 的团队来说,多模态输入和二次修改这两点直接省掉反复重生成的时间。
Suno v6 支持把图片、视频、语音备忘录直接转成音乐,还能对已生成的歌做精细修改,另有一个 v6-wild 分支。做短剧配乐和后期声音的这周可以上手跑一遍。
点击打开原平台查看,能否访问取决于网络环境
OpenAI 开发者账号宣布 GPT-Live-1 已在 API 中开放,主打把 ChatGPT 的自然来回对话能力带进应用,支持语音 agent 的实时聆听与交互。对做 AI 配音、虚拟角色对话、实时语音交互的后期和短剧团队来说,这是可以直接接进现有流程的语音能力接口,具体延迟、语言覆盖和定价需看官方文档。
OpenAI 把 ChatGPT 那种自然来回对话的语音能力开放成 API,做 AI 配音、虚拟角色对话、实时语音交互的团队可以接上测一周,看延迟和打断处理能不能撑住真实场景。
点击打开原平台查看,能否访问取决于网络环境
DeepSeek 发布 V4.1 Flash,采用 Causal-Encoder-Decoder 结构的 552B 参数 MoE 模型,输入激活 8B、输出激活 16B,具备原生多模态视觉理解能力,基准测试超过包括 DeepSeek V4 Pro 在内的旗舰模型,同步开源并下调 API 定价。对做批量素材理解、脚本辅助和自动化流程的团队,开源加降价意味着可以自部署或低成本接入,但官方未公布视频生成类能力。
552B MoE、输入激活 8B 输出 16B,原生多模态视觉理解,基准超过自家 V4 Pro,还同步开源并下调 API 价格。做工具链和批量调用的可以接 API 跑一轮,看视觉理解和成本能不能替掉现在用的模型。
点击打开原文,能否访问取决于网络环境
Synthesia 发布数字人模型 Express-3,官方称是其目前最先进的 Avatar 模型,具备情绪感知表演能力,口型同步和身体动作更自然,视频生成速度提升 2 倍。Express-3 同时驱动 Style Avatars 功能,可从提示词或预设生成风格化角色。适用于口播视频、虚拟主播、AI 短剧角色出镜等场景。
数字人模型 Express-3 主打情绪感知表演、口型同步和身体动作自然度,生成速度翻倍,还带一个从提示词或预设生成风格化角色的 Style Avatars。做口播、虚拟主播、AI 短剧角色出镜的可以接进去测一周,重点看情绪表演和口型这两块。
点击打开原平台查看,能否访问取决于网络环境
Krea 官方介绍 Krea Agents(该产品 9 月 4 日已发布),定位为面向创意工作的智能体,官方称其深度了解创作工作流,并配备带自我改进记忆的上下文管理器,随附宣传物料和教程链接。对做视觉开发和批量出图的创作者来说,值得实测它能否把重复性的创作环节自动化。
Krea 官方放出面向创作流程的 Agent(该产品 9 月 4 日已发布),主打懂创作工作流和带自我改进记忆的上下文管理,做视觉和批量出图的可以上手跑一遍看它能不能接进现有流程。
点击打开原平台查看,能否访问取决于网络环境
微软AI CEO Mustafa Suleyman 公布:两个月内发布 8 款新模型,其中 5 款登顶榜首,图像、语音、转录三条线平均每 7 周推出一款。MAI-Transcribe-2 号称全球最快、最准、最便宜的转录模型;MAI-Image 2.5/2.6/2.6 Flash 首发即登顶 Artificial Analysis 排行榜;MAI-Cyber 在 CyberGym 排名第一且成本节省 50%。
微软AI CEO 自己晒成绩单:两个月 8 款模型、5 款登顶,图像语音转录平均 7 周一款。做视觉和后期配音的可以盯 MAI-Image 2.6 和 MAI-Transcribe-2 的实际出片效果。
点击打开原文,能否访问取决于网络环境
HeyGen 宣布实时 AI 体验框架已开源,称与 OpenAI 合作构建,组合了 GPT-Live-1、LiveAvatar 和 HyperFrames 三部分,并放出 demo 供查看。推文未展开具体参数、延迟数据或接入方式,细节需看链接原文。对做实时虚拟人、AI 主播和互动角色的团队来说,这是一条可跟进的工具链开源消息。
HeyGen 拉上 OpenAI 把实时 AI 体验的框架开源了,串的是 GPT-Live-1、LiveAvatar 和 HyperFrames 三件套。做虚拟人直播、实时对话角色的技术整合者可以拉下来跑一遍,看延迟和口型能不能扛住。
点击打开原平台查看,能否访问取决于网络环境
Hugging Face 发布 Workflow1111,用 gr.Workflow 以 73 个节点、11 条媒体工作流重建 AUTOMATIC1111 的大部分功能,覆盖文生图、高清修复、图生图、prompt matrix、VLM 反推提示词、检测生成 inpaint 蒙版、ControlNet 式预处理器、背景移除、PNG Info 和图生视频。对做图像工作流的视觉师和技术整合者来说,这是一份把老牌 WebUI 功能拆成可视化节点的参考实现。
把 A1111 那套文生图、高清修复、ControlNet 预处理、蒙版 inpaint 拆成 73 个节点串成可视化工作流,习惯 ComfyUI 的视觉师可以对比着看节点怎么搭。
点击打开原文
OpenAI 发布 ChatGPT for Financial Services,内置金融数据,搭载 GPT-6 Astra 模型,面向研究、建模和客户交付材料场景。这是面向金融行业的垂直产品,与影视/AIGC 创作工作流无直接关联。
面向金融行业的垂直版 ChatGPT,内置金融数据加 GPT-6 Astra,做影视的跟这条关系不大,除非你接金融客户的项目。
点击打开原平台查看,能否访问取决于网络环境
Google 官方宣布 Gemini App 即日起面向 Windows 10 和 Windows 11 全球上线,用户可通过官方链接下载桌面客户端,官方同时提供更多说明页面。这是 Gemini 桌面端在 Windows 平台的可用性扩展,此前该 App 已在其他平台提供。对影视创作者而言,这条属于通用 AI 助手的平台覆盖更新,不涉及视频生成、图像编辑或创作工作流能力,日常写剧本、查资料时多一个桌面入口。
Google 官方宣布 Gemini 桌面 App 全球上线 Windows 10/11,可直接下载。日常写剧本、查资料、整理分镜的编导可以装一个当桌面助手,跟创作工作流关系不大。
点击打开原文,能否访问取决于网络环境
Nebius AI Builder Program 开放申请,免费提供 400 美元以上额度与折扣,附带可运行代码和 cookbook、工程师 office hours 及社区支持,覆盖开源模型、调度、检索、评估和可观测性等环节。分享者 @omarsar0 评价这是上手搭 Agent 的好资源。对需要自建生成或处理流程的技术整合者,这是一份可直接试用的算力与文档入口。
Nebius 的 AI Builder 计划免费给 400 美元以上额度,还配可运行代码、cookbook 和工程师 office hours,自己搭 Agent 流程的技术整合者可以注册跑一遍试试成本。
点击打开原平台查看,能否访问取决于网络环境
Adobe 为 Premiere 推出全新的生成式媒体工具,在工作空间内置浮动任务栏,用户可直接从时间线生成上下文感知的 B-roll 视频和音效,操作方式是选择模型并编写提示词来填补素材空缺,官方提示更新 Premiere 即可使用。对后期和剪辑岗位来说,生成能力被直接嵌进时间线,补镜头和补音效不用再切外部工具。
剪辑师直接在时间线上选模型、写提示词补 B-roll 和音效,不用再切到外部工具来回导素材,做短剧和广告后期的这周更新 Premiere 就能试。
点击打开原平台查看,能否访问取决于网络环境
Luma Labs 给 Layers 加了文字提取功能:选中图层点 Extract,画面里烘焙进图层的文字会被转成可编辑的实时文本,并自动套上字体库里最接近的字体,可以直接改字、换字体、重新排版。官方说法是改一句文案从「重新生成一张图」变成两次点击。对做海报、KV、电商图的视觉和后期来说,这意味着出图后的文案微调不用再回炉重跑。
做海报和 KV 的视觉师可以试:选中图层点 Extract,图里的字就变成可编辑文本并自动匹配最接近的字体,改文案不用整张重生成。
点击打开原平台查看,能否访问取决于网络环境
Intangible AI(@intangibleai)推出 Motion Paths 功能,用户可在真实几何体上直接绘制相机与物体的运动路线,设定线条后场景按绘制的轨迹运动,替代用文字描述镜头运动的方式。适合需要精确控制运镜和物体走位的分镜、预演环节。
镜头运动不用再靠文字描述猜,直接在真实几何上画出相机和物体的行进路线,做分镜和运镜的可以上手试这条路径工具。
点击打开原平台查看,能否访问取决于网络环境
面壁智能(@OpenBMB)转发开发者 @XieZhifei14110 的集成工作:把语音生成模型 VoxCPM 与开源记忆系统 VoiceMem 接在一起,为实时语音智能体同时提供自然表达语音和流式记忆。VoiceMem 在对话过程中持续检索相关记忆,并记录事实、说话人身份、情绪、偏好和性格;VoxCPM 负责自然、有表现力的语音输出。两个仓库均已公开:VoiceMem 在 GitHub(xzf-thu/VoiceMem),VoxCPM2 在 Hugging Face(openbmb/VoxCPM2)。
面壁智能的语音模型 VoxCPM 接上了开源记忆系统 VoiceMem,语音智能体在对话中能持续记住说话人身份、情绪和偏好。做 AI 配音、虚拟角色对话、互动剧的后期和技术整合可以拉下 GitHub 跑一遍。
点击打开原文,能否访问取决于网络环境
OpenRouter 推出有状态服务端工具 Shell,平台上任意模型现在都能在托管 Linux 容器里执行命令,并通过新的 Files API 传入传出文件,今日以 beta 形式开放,标识为 `openrouter:shell`。对做自动化流程的团队来说,这意味着模型可以直接调用命令行工具处理素材,比如批量转码、格式转换、脚本化剪辑,不用自己搭容器环境。
OpenRouter 给所有模型加了托管 Linux 容器和 Files API,能跑命令、传文件,做批量转码、自动剪辑脚本这类活儿的可以接上试试。
点击打开原平台查看,能否访问取决于网络环境
Recraft 官方宣布 Recraft V4 Styles 已在 ElevenCreative 平台上线,主打为工作产出风格一致的视觉素材。原文只给出这一句可用性说明和跳转链接,未列出具体参数、价格或调用方式。做视觉开发和 KV 的可以进 ElevenCreative 实测同一套风格在多张图上的复用稳定性。
Recraft 的风格一致性能力进了 ElevenCreative,做视觉开发和 KV 的可以进去试一下同一套风格能不能稳定复用。
点击打开原文,能否访问取决于网络环境
Magnific 宣布平台上所有 Kling 模型限时降价 20% 积分消耗,覆盖 Kling 全系模型,活动为限时性质,未说明截止时间。对用 Kling 批量出镜头的短剧和广告团队来说,这是直接压成本的窗口期,适合把积压的素材集中跑掉。
Magnific 平台上的 Kling 全系模型限时降价 20% 积分,做批量出片的制片和短剧团队可以趁窗口期把积压的镜头跑掉。
点击打开原文,能否访问取决于网络环境
OpenAI 官方宣布,Dropbox、Box 和 SharePoint 现已原生集成进 ChatGPT 库,覆盖 ChatGPT 与 ChatGPT Work 两个版本,本周起向付费用户推送。此前这些云盘文件需要手动上传或走第三方连接器,现在可直接在 ChatGPT 内检索调用。对需要跨团队调取素材、脚本、合同等文档的制片和项目运营来说,减少了文件搬运环节。
做团队协作的可以留意:素材和文档不用再手动上传,ChatGPT 里直接调 Dropbox/Box/SharePoint 的文件。本周向付费用户推送,管项目资料库的制片和运营可以试一下检索效率。
点击打开原文,能否访问取决于网络环境
据 Testing Catalog 消息,Meta 的 Muse 助手将支持自定义语音创建:用户可直接在聊天中用提示词让 Muse 生成任意语音,生成结果可在语音模式中选用。该功能据标签推测可能由 MAI 模型驱动,但 Meta 也常引入其他实验室模型做基准测试。此外用户可为 Muse 智能体开启「工作音效」,听到头像「打字」的声音。
Muse 里打一句提示词就能生成任意音色,还能在语音模式里直接选用,做 AI 配音和虚拟角色对话的可以留意它后续开放范围。
点击打开原平台查看,能否访问取决于网络环境
OpenAI 在 ChatGPT Work 中上线 Data agent,可接入公司数据源,用自然语言查询并生成洞察,还能直接搭出可交互的数据看板。定位是企业数据分析和报表场景,面向需要处理业务数据的团队。对影视创作流程来说,这条属于办公侧能力,编导、视觉、后期、短剧生产环节基本用不上,只有制片统筹、项目成本与投放数据复盘这类岗位可能有参考价值。
OpenAI 给 ChatGPT Work 加了 Data agent,接公司数据、自然语言出洞察和交互看板。做制片统筹和项目数据复盘的可以留意,跟拍片工作流关系不大。
点击打开原文
Runway 公布实时视频生成研究思路:对 Gen-4.5 等基础模型做后训练,先转为时间因果的逐帧自回归生成,再用分布匹配蒸馏把每帧压缩到几步,实现边输入提示词边流式输出视频与音频。该方法以首帧时间和整体生成时长为优化目标,官方称可降低 GPU 占用与单条输出成本。
Runway 把 Gen-4.5 改成逐帧自回归加蒸馏,做到边打字边出画面和声音,还压低了 GPU 占用。做实时互动内容和直播向玩法的团队可以盯这条技术路线。
创作者 @covacut 演示用 Astra 给视频加漂浮物体:Astra 自动生成 3D 物体、将其放入 After Effects、为旋转打关键帧并完成场景布光,作者称「VFX 是为每个人准备的」。这条展示的是 AI 直接操作 AE 完成合成与关键帧的流程,对做后期合成、特效包装的团队有参考价值。
后期和 VFX 的可以盯一下:一句话让 Astra 建 3D 物体、放进 After Effects、给旋转打关键帧还顺手布光,等于把合成环节的重复劳动交出去。
点击打开原平台查看,能否访问取决于网络环境
作者分享一套免环境、原生接入飞书的 AI 内容自动化流程,覆盖灵感入库、快判立项、知识库、写作 Skill 到成果交付五个环节。AI 在工作日早八点自动去飞书看板挑题、打分,按作者文风生成带人工确认闸门的长文与 PPT。作者公开了整套飞书作战库字段、快判 Prompt 和写作 Skill 协议原文,称照着抄半小时可搭完自己的生产线。
从选题入库到长文加 PPT 全流程跑在飞书里,早八点自动挑题打分、按作者文风出稿,还留了人工确认闸门。做内容批量生产的团队可以照着搭一套,公开了字段和 Prompt 原文。
点击打开原文,能否访问取决于网络环境
作者 @heyrobinai 分享一套用 ChatGPT 逆向图片风格的五步流程:上传参考图后,用固定 prompt 让模型把画面的颜色、光线、排版、构图、质感和特效抽成可复用的 JSON,并挑出 3 个必须保留的核心特征,同时排除主体、logo 和文字;把这份 JSON 存成风格档案,之后生成时附上并写「用这个风格档案生成 XX」;最后把成片和参考图一起传回去,让模型找出 3 个最大差异并重写生成 prompt,在保留新主体的前提下把风格拉近参考图。
五步工作流:上传参考图→让 ChatGPT 抽出颜色/光线/排版/构图/质感写成 JSON→存成风格档案→生成时挂上→再让模型对比成片和参考图改 prompt。做视觉开发和 KV 的可以拿自己手上的参考图跑一遍。
作者把豆包工作接入飞书多维表格与云文档,搭出一条从选题快判、云电脑定时巡检到长文初稿、PPT/Excel 落盘的内容自动化流程,公开了建表提示词、快判规则和自定义写作 Skill 协议。流程里设了人工确认闸门,并用【F】【W】【I】【?】四类标记给事实打标。作者同时点出三个局限:浏览器录制还在灰度、确认闸门不能删、企业飞书权限受限。
把豆包工作接进飞书多维表格和云文档,选题快判、定时巡检、长文初稿到 PPT 落盘一条龙,建表提示词和写作 Skill 协议都公开了。做内容运营和 MCN 的可以照着搭一套,注意人工确认闸门别删。
点击打开原文,能否访问取决于网络环境
Leonardo 创意团队用平台内的 Seedance 2.5 做了一支实验短片《Seedance Tribal》,全片没有对白也没有常规剧情,靠服装、色彩和动作推进叙事。这是团队内部的一次实验性尝试,探索无剧本条件下的影像表达。
无台词、无常规剧情,全靠服装、色彩和动作推进叙事,做视觉开发和风格化短片的可以拉片看它怎么用画面讲故事。
点击打开原平台查看,能否访问取决于网络环境
BytePlus 官方账号转发创作者 @DiDi_OKK 的科幻短片《CANDY》,用 Dreamina Seedance 2.5 制作,主题设定在「暴力不再是选项」的世界,围绕这一假设展开科幻叙事。
BytePlus 官方转发的 Seedance 2.5 科幻短片,题材是「暴力不再是选项的世界」,做 AI 科幻短片的可以拉片看它的世界观视觉和叙事处理。
点击打开原平台查看,能否访问取决于网络环境
BytePlus 官方账号分享的 AI 短片《CANDY》,由 @DiDi_OKK 创作,主题是设想另一种文明如何看待人类、这种视角能揭示人类的什么。短片使用 Dreamina Seedance 2.5 制作,把多种不同的视觉风格和定制视觉特效组合起来,构建其科幻世界观。
Seedance 2.5 做的科幻短片,卖点是把多种视觉风格和定制特效揉进同一个世界观,做科幻题材的视觉师可以拉片看风格切换怎么处理。
点击打开原文,能否访问取决于网络环境
