01
@HeyGen
HeyGen 发布新语音模型 HeyGen Voice,称在 Artificial Analysis TTS 排行榜盲测中击败所有主要模型登顶,现已在 HeyGen 平台和 API 上线。API 用户 10 月 31 日前享 50% 折扣,每百万字符 15 美元(原价 30 美元),自动生效。适用于配音、虚拟角色对话、短剧对白等语音生成场景。
HeyGen 新语音模型在 Artificial Analysis TTS 盲测榜登顶,API 已上线且 10 月 31 日前每百万字符 15 美元(原价 30)。做 AI 配音、短剧对白、虚拟角色口播的可以接 API 跑一周,比一比废音率和情绪自然度。
点击打开原平台查看,能否访问取决于网络环境
02
@Alibaba_Qwen
通义千问发布 Qwen-Image-2.1-Turbo,基于同一 7B 视觉生成架构的加速版本,只需 8 个去噪步骤即可完成图像生成和编辑,权重已开放。对做图像批量生产和本地部署的视觉团队来说,步数压缩意味着单张出图耗时大幅下降,适合接进自己的出图流程里实测速度与画质的平衡点。
8 步去噪就能出图和改图,还开放权重,做批量出图和本地部署的视觉团队可以拉下来跑一遍,看速度和质量能不能顶住日常产能。
点击打开原文,能否访问取决于网络环境
03
@rohanpaul_ai
Pine 发布为 AI Agent 构建的云端计算机 Pine Computer,开发者通过 SDK 创建实例,用自然语言下达任务,由 Agent 在网站、文件和应用间自行规划并执行。运行 GPT-5.6 Luna 时,官方称在 SaaS-Bench v1.1 上模型 token 成本约为 GPT-5.6 Sol + Codex 的 1/20,checkpoint 得分 78.3% 为公开对比中最高,约为 Opus 5 + Claude Code 的 1/26,部分内部初步测试中快 2-5 倍。
给 Agent 单独造一台云端电脑,开发者用 SDK 开实例、说人话派活,它自己跨网站和文件干活。跑 GPT-5.6 Luna 时 token 成本只有 Sol+Codex 的约 1/20,做自动化流程的可以接 SDK 试一周。
点击打开原平台查看,能否访问取决于网络环境
04
@ArtificialAnlys
HiDream 发布 HiDream-O1-Video-1.0,定位原生全模态视频模型,主打物理一致性,可生成 1080p、5 到 20 秒带原生同步音频的视频,时长由场景决定而非预先固定。在 Artificial Analysis Video Arena 图生视频(含音频)榜首秀排第 6,紧随 Dreamina Seedance 2.0 720p,与 MiniMax H3、Vidu Q4 Preview、Gemini Omni Flash 同梯队,领先 Wan 3.0。定价每分钟 1080p 带音频视频 5.80 美元(约每秒 0.10 美元),已通过 HiHarness API 和 vivago R1 Studio 提供。
国产新模型首秀就挤进图生视频带音频榜第 6,紧跟 Seedance 2.0,1080p 带原生同步音频、时长按场景自动定,做短剧和配音的可以拿它跟手上模型对比着跑几条。
点击打开原平台查看,能否访问取决于网络环境
05
@fal
fal 官方发布 Claude Motion 与 fal Claude Connector 两款新产品,并附上 YouTube 完整视频链接。推文正文仅给出产品名称和视频地址,未说明具体功能、参数或接入方式。对做自动化出片流程的团队来说,值得点开视频确认这两个工具能否接进现有的生成工作流。
fal 把 Claude 接进了自己的生成平台,Motion 和 Connector 两个新东西具体能干什么还得看视频,做自动化出片流程的可以先点开看看。
点击打开原平台查看,能否访问取决于网络环境
06
@fchollet
Busabase 团队推出开源(MIT)的智能体数据库与工作空间,解决智能体产出困在孤立聊天记录、无法积累的问题。智能体不再把工作丢在临时对话里,而是直接写入结构化工作空间,把输出转成可复用的数据、文档和技能,供整个团队访问。详情见 busabase.com。
智能体产出不再散落在聊天记录里,而是写进结构化工作空间变成可复用数据、文档和技能,MIT 开源。自己搭 Agent 流程的可以拉下来跑一遍,看能不能接进现有的素材和脚本管理。
07
@Stjerrild
Synthesia 的 Steffen Tjerrild 发推宣布 Syren 上线,称其为「视频版 ChatGPT」,并附上 synthesia.io/syren 产品页链接,表示期待看到用户的创作。推文本身只有一句话加链接,未展开具体能力、参数或价格。做数字人播报、口播视频批量生产的团队可以点开产品页确认实际功能。
Synthesia 官方人员放出的 Syren 产品页,自称「视频版 ChatGPT」,做数字人播报和批量口播视频的可以点进去看它到底能做什么。
点击打开原平台查看,能否访问取决于网络环境
01
@ArtificialAnlys
Artificial Analysis 用同一张照片对 GPT Image 2.5 Sunburst、Ideogram 4.5、FLUX 3、Nano Banana 2.1 做了 30 步连续房地产布景编辑(点火、加沙发、刷墙、白天换黄昏等),每步基于模型自己的上一步输出。结论:Ideogram 4.5 和 FLUX 3 走局部编辑,小改动时 95% 以上画面不动;GPT Image 2.5 每次重绘整图,仅约五分之一画面不变,色彩细节偏差逐步累积;Nano Banana 2.1 居中,编辑局部但整体画面轻微偏移并逐渐变暗。
同一张图连改 30 次,Ideogram 4.5 基本保住原图,GPT Image 2.5 每步重绘整张导致漂移累积。做分镜迭代和场景反复改稿的视觉师值得看这份对比。
点击打开原平台查看,能否访问取决于网络环境
02
@higgsfield_ai
Higgsfield 官方发布一条产品广告,称由 Claude Motion 与 Higgsfield Katana 组合、全程用代码一次性生成,未经过多轮返工。官方给出的判断是 AI 动态设计开始接近可交付水准。对做产品广告、动态设计和电商物料的团队来说,这是一条纯代码路径的成片样本,可用来判断画面质感和交付完成度。
纯代码路径一次跑出产品广告成片,做电商广告和动态设计的可以点开看画面质感,判断这条路线能不能替掉部分实拍和后期。
点击打开原平台查看,能否访问取决于网络环境
03
@lovart_ai
Lovart 放出 Nano Banana 2.1 与 GPT Image 2.5 的人像生成左右对比图,左侧为 Nano Banana 2.1,右侧为 GPT Image 2.5,称前者在人像打光和皮肤质感上有明显提升(该产品 10 月 6 日已发布)。对比图由 Lovart 制作。做角色定妆、人像海报和写实人物素材的视觉创作者,可据此判断两个模型在皮肤细节和光线处理上的差异。
Lovart 放出 Nano Banana 2.1 与 GPT Image 2.5 的人像左右对比,主打打光和皮肤质感。做角色定妆、海报人像的视觉师可以拉图看细节差异,再决定用哪个出图。
点击打开原文,能否访问取决于网络环境
04
@yyyole
作者用 GPT-6 Astra + Tripo3D + Blender + Claude Opus 5.5 组合,让 Codex 操作电脑自动完成从生成图片、Tripo 生成 3D 模型、绑骨骼拆分、Blender 减面组装搭场景,到 Opus 5.5 完善玩法逻辑的全流程,一晚做出可玩的荒岛狩猎游戏 Demo,角色可移动、切换手枪猎枪和刀、开镜射击、猎物会主动攻击。作者特别提到 Tripo 新上的 P2.0 模型能生成干净可用的拓扑面,高精度模型可直接进入游戏开发和动画制作流程,省去大量细调时间。
一条把 Codex、Tripo3D P2.0、Blender、Opus 5.5 串成自动流程的实测记录,从出图到 3D 资产到场景组装全程 AI 操作电脑完成。做 3D 资产和自动化工作流的可以拆它的分工方式。
点击打开原平台查看,能否访问取决于网络环境
05
Recraft AI Blog
Recraft 官方博客发布教程,讲如何在 Recraft Studio 里把一张角色主图转成转身图(turnaround)、表情表(expression sheet)和姿势表(pose sheet)三套参考素材,目的是让角色在后续每一张新图里保持同一形象。教程面向需要跨图维持角色一致性的创作场景,属于工具使用说明类内容。
角色一致性是 AI 短剧和动画最头疼的一环,这篇官方教程把一张主图拆成转身图、表情表、姿势表三套参考,做角色 IP 和系列片的视觉师可以照着跑一遍。
06
@lemomo_ai
开源项目 lemo-opuscar 更新,把短片《Opuscar 98》里 98 个奥斯卡最佳影片场景复刻的风格、提示词和导演执导思路全部公开,网站支持一键复制提示词复刻对应风格。项目 GitHub 已获 1.5K star,不用 Claude 的用户可以把仓库丢给 Grok bot 本地跑 skill。
98 部奥斯卡最佳影片的场景复刻风格、提示词、导演执导思路全公开,网站可一键复制,做视觉开发和风格参考的可以扒下来当素材库。
点击打开原文,能否访问取决于网络环境
07
@ClaudeDevs
Anthropic 开发者账号发布 Claude Managed Agents 自动化搭建指南:可部署一个按计划定时读取 Slack/GitHub 的 Agent,支持凭证与记忆,并自动发布更新;通过一条 Claude Code 命令即可完成设置,Max 和 Team 套餐包含新的 API 额度。对做创作流程自动化的技术整合者来说,这套定时抓取+自动发布的模式可迁移到素材收集、进度同步等环节。
官方教程:用一条 Claude Code 命令部署定时读 Slack/GitHub 的 Agent,带凭证和记忆,Max 和 Team 套餐含新 API 额度。做自动化流程的技术整合者可以照着跑一遍。
08
@maxescu
创作者 Alex Patrascu 分享自己的 Claude Shorts 工厂:因用量消耗过快,改用一台 Mac Mini 24 小时常驻运行;同时新增 3 个 skill 对应 3 个内容品类,每个 skill 产出一整套制作包,含可编辑工程、上传物料(缩略图、标题、描述等)、脚本、清单、分镜、旁白、封面和提示词。目前进入上传与频道管理阶段。
个人创作者把 Claude 做成短视频批量生产线,一个 skill 直接吐出脚本、分镜、旁白、封面、标题描述全套物料,做短剧和账号矩阵的可以看看这套拆法。
点击打开原平台查看,能否访问取决于网络环境
09
@kevin_t_ngo
Kevin Ngo 分享:先让 Claude 用 JavaScript 逐帧绘制 2D 动画并编写钢琴乐谱,再把这部 2D 成片作为参考交给另一个 Claude,因为整部影片都是代码,Claude 得以复用完全相同的调度,在 Blender 中生成 3D 版本。核心在于用代码作为中间层,让同一套动作调度在 2D 与 3D 之间直接迁移。
整部片子是代码,Claude 先写钢琴谱、逐帧画 2D,再把同一套调度搬进 Blender 出 3D。做程序化动画和想用 Agent 串制作流程的可以拆一下这个思路。
点击打开原平台查看,能否访问取决于网络环境
10
@elevenlabs
ElevenLabs 与医疗机构 Banner Health 合作,用 ElevenAgents 语音智能体接听患者来电,从初级保健预约切入。患者可全天候拨打,智能体直接在 Banner 的电子病历系统中完成预约、改期、取消;需要人工时通话转接给 Banner 团队成员并附带上下文信息。这是语音智能体在医疗场景的一次业务落地案例。
语音智能体直接写进医院电子病历系统、能预约改期取消、转人工还带上下文——做 AI 客服和语音交互产品的可以看这套落地样本。
点击打开原文,能否访问取决于网络环境
11
@emollick
宾大教授 Ethan Mollick 发推评论 Google 在 Gemini 4 之后的挑战:他认为关键不在模型本身,而在如何用好一个优秀模型。他指出 Anthropic 和 OpenAI 正走向用调度型智能体、以单一界面处理多种任务的方向,而 Gemini 3 时代的产品线分散在众多市场,这种碎片化打法对下一步行不通。属个人观点,无具体产品信息。
当天有 4 家独立信源在报同一件事,属于行业动向本身。对具体创作流程没有直接用处,但这个量级的消息值得知道。