01
HuggingFace Daily Papers
dots.tts 是一个 2B 参数的开源连续自回归 TTS 模型,核心创新包括多目标训练的 AudioVAE 构建连续语音空间、全历史条件 flow-matching 头保证长文一致性、无奖励自纠正后训练提升鲁棒性。在 Seed-TTS-Eval 上中文 WER 0.94%、英文 1.30%、中文-hard 6.60%,SIM 分别为 81.0/77.1/79.5,达开源 SOTA。推理延迟低:输出流首包 85ms,双流 54ms。训练推理代码及检查点已开源。
2B 参数的开源 TTS 基座模型,中文 WER 低至 0.94%,推理首包 85ms。做 AI 配音、后期、虚拟角色对白的可以直接拉代码跑一遍,看音质和长文一致性够不够进生产管线。
02
@xiaohu
小互开源视频翻译工具,一句话指令即可全自动完成视频下载、Whisper本地转写、AI翻译润色、烧字幕、出文稿。转写本地运行不花API费,支持YouTube、B站、抖音等链接及本地文件,英语、日语、韩语、法语、西班牙语等均可转成中文字幕。字幕精确到词级时间戳,按语义断句,每行不超过12字,提供纯中文与中英双语模式。工具由三个子技能组成,可单独或串联使用,适配Claude Code、Codex等AI编程工具,已开源附安装指南。
后期和短剧团队做海外素材本地化、多语言字幕批量生产的,可以直接拉下来跑一遍,省掉手动转写翻译的环节。
03
@perplexity_ai
Perplexity 与哈佛大学联合发布研究,对比自主 AI 智能体(Computer)与纯搜索界面在知识工作场景中的效率。3 个月实验数据显示,使用 Computer 的工人完成任务速度快 87%,成本低 94%,且用户满意度更高。研究指向从聊天界面转向自主智能体的工作流变革。
Perplexity 和哈佛联合出的研究,数据扎实:自主 AI 智能体比纯搜索快 87%、省 94% 成本。做 AI 工作流编排和自动化管线的技术整合者值得细读,制片人也可以拿这个数据去算团队提效空间。
04
@cuisitekp
Openclaw 作者 Peter Steinberger 提出 Loop Engineering 概念,主张构建闭环系统替代手动写 Prompt 和盯 Agent 跑代码:系统自动 prompt agent、跑结果、判断对错、决定下一步。核心是从单次交互转向可自循环的任务设计。
做 AI 短剧批量生产或工具链整合的,可以看看 Loop Engineering 的思路——把 Agent 从单次对话变成自动闭环,省掉反复盯 Prompt 的人力。
05
@EHuanglu
创作者 @EHuanglu 发布 AI 短片,声称耗时 2 天制作,主题聚焦 AI 演员对真人演员的冲击。推文附有提示词和工作流链接(buzzy 平台)。
个人创作者 2 天出片,附了提示词和工作流链接,做 AI 短片的可以直接扒流程跑一遍,看 2 天能到什么质感。
06
@mranti
个人开发者 Michael Anti 用 DeepSeek V4 Flash 自建 epub/pdf/OCRpdf 翻译程序,并发引擎加审查 fallback,称古文和汉语人名翻译效果远超 DeepL。
个人开发者用 DeepSeek V4 Flash 自建翻译管线,专治古文和汉语人名翻译痛点。搞 AI 后期字幕和本地化翻译的可以看看这个思路,自己搭一套也不难。