
Clipifai
将文档和电子书转换成自然语音的有声书。
@coder_zi · X
Clipifai converts e-books to audiobooks say you have a few books in mind to read, but haven't really had the time to read them, you could just convert them into audiobooks and listen to them on the go...
完整作品展
技术栈
20 projects

将文档和电子书转换成自然语音的有声书。
@coder_zi · X
Clipifai converts e-books to audiobooks say you have a few books in mind to read, but haven't really had the time to read them, you could just convert them into audiobooks and listen to them on the go...

用AI转录音频和视频为文本和摘要
@Mahima_Akkina · X
Yes, you can check - It's a tool used to convert both and video into text and summaries

Segment Anything for Audio — made simple. Separate audio with a text prompt. Isolate vocals, remove background music, extract speech from noise. Privacy-first stem splitter powered
@sambamdamnn · X

在浏览器中用播客级别的语音朗读文章。
DmitryDolgopolo · HN
ReadAloud – on-device, podcast-quality text-to-speech in the browser

快速、精准的 AI 音频转录工具,无需注册,支持多种格式和语言。
音频转文字工具 — AI 音频转文字,快速、精准、安全的转写服务

上传音频或视频,SayScribe 自动转成带说话者标签和时间戳的文字稿。
zxhywork · V2EX
SayScribe AI - 音频转文字的在线工具 花了几周搞了一个基于 OpenAI Whisper 的 AI 转录工具 **[SayScribe]( https://sayscribe.org)**,目前 5 个工具全部免费,每天 3 次无需注册。上线前请 SEO 专家做了一轮诊断,踩了不少坑,分享出来给同样在做工具站的 V 友参考。 --- ## 做了什么 核心工具是 **[Audio to Text Converter]( https://sayscribe.org)**(主页),上传音频/视频文件,AI 自动转成带 speaker labels 和时间戳的文字稿。选这个词的原因是:Google 第一页有个 DR 只有 10 的小站排第三,KD 才 20.2 ,链接预算只要 15-35 个引用域就能进前十——典型的弱盘面蓝海。 然后在主页基础上拆了 4 个子工具,每个打一个独立搜索词: - **[MP3 to Text]( https://sayscribe.org/mp3-to-text)** — 只转 MP3 。KD 41.7 比主页难一些,但

将 MP3 和 MP4 文件转换为带有时间戳和说话人识别的可编辑文字稿。
digiplanp · V2EX
做了一个音视频转文字工具,支持 MP3/MP4、说话人识别和字幕导出 大家好,最近做了一个在线音视频转文字工具 ToText ,想发出来请大家体验一下,也听听 V 友的意见。 最开始做这个工具,是因为我自己在处理会议录音、访谈和视频内容时,发现单纯生成一大段文字并不太实用。转录完成后,通常还需要反复对照原始录音、修改错误、区分说话人,再整理摘要或字幕。 所以现在做成了一个相对完整的工作流: * 上传 MP3 、MP4 、M4A 、MOV 、WAV 、WebM 等音视频文件 * 自动识别语言并生成带时间戳的文字稿 * 支持说话人识别和说话人名称修改 * 点击文字片段可以跳转到对应的音视频位置 * 可以搜索、编辑和校对转录内容 * 自动生成摘要、会议纪要、章节和行动事项 * 支持导出 TXT 、DOCX 、PDF 、SRT 、VTT 、CSV 和 JSON 音频文件可以直接使用 [MP3 to Transcript]( https://totext.app/) 功能,比较适合播客、访谈、课程录音、会议和语音备忘录。 视频文件也使用同一个编辑器,通过

将语音转录为整洁清单,可复制到笔记和应用。
emadda · HN
list55.com: Transcribe a list into plain text

API 和 MCP 服务器,可将社交视频和播客转录为带时间戳的文本。
chandler_casey · Product Hunt
TranscriptFetch Video and audio transcripts, structured for AI

将录音或视频转录为带时间戳和说话人识别的可编辑文本。
lavande · V2EX
做了一个语音转文字的工具,另加 AI 总结、翻译、提问等(附踩坑记录) 先上链接:[Echoryte]( https://echoryte.com/) 感觉这个网站 vibe coding 的话,感觉手熟的同学可能半天就能搓出来…… 但是我用了一个多月才上线,主要是被 GPT5.6 坑了,当时 5.6 和 fable 前后发布,然后试了试用 fable 5 做的 plan ,然后 5.6 sol 推理开到最大去执行。结果愣是给我干了 33 个小时没停,写了将近 2 万行代码。 但是坑就坑在这,推理开太高,就过度思考了,给我整了很多虚头巴脑的东西出来,什么“门禁”我也不懂,什么合规,一大堆,然后我就不停地删,删了一个月,最后我就跟 GPT 说,我特么是个人小项目,不是大公司,再这么高下去永远上不了线了。然后终于看删的差不多了,上线了! 欢迎大家试用,轻拍,谢谢!

用于语音、聊天和视频面试的 AI 平台,提供自动转录和分析。
Aural — 开源 AI 面试平台,支持语音、聊天和视频面试,提供自适应追问、结构化评分、面试练习与自托管 - [查看仓库](https://github.com/1146345502/aural-oss)

在伦敦画廊拍摄艺术作品,获取AI识别、音频导览和博物馆信息。
victords · HN
I was interested in learning more about reverse image search, so I built audioguide.london. It’s a simple image search where you take a photo of an artwork in a gallery, tries to ID it and returns a pre-generated audio and a link to the museum website. The audios were all generated locally, essentially looking at the contents of the website, running it through a LLM to generate a script and Kokoro for TTS. I’ve built it as an app for myself almost a year ago, so I deployed it as a vibe coded web