AI工具分类聚合库 [949 个收录]
全网最全的 AI 生产力工具雷达。包含大语言模型、图片生成、智能音频、视频渲染及自动化编程开发工具,一键直达官方及评测详情。
支持 GraphQL 与 Redis 缓存,可一键读取 949 个工具的参数:
VoiceReplace
需求人群 适用于社交媒体视频创意本土化、公司培训视频本土化语音、修复屏幕录制等场景。 使用场景 社交媒体视频本土化语音 公司培训视频本土化语音 广告内容创作 产品特色 AI语音替换 自动同步功能 多种语音选择 多语言支持(即将推出) 客户支持
Resemble Enhance
需求人群 ["提升语音通话质量","增强语音助手语音质量","提升视频语音质量"] 使用场景 通过pip安装resemble-enhance,命令行运行增强语音文件 基于提供的源代码,训练自定义的语音降噪与增强模型 通过本地Web界面上传语音文件进行在线增强 产品特色 语音降噪 语音增强 支持pip安装使用 提供本地Web界面 开源代码 自定义模型训练
Speechimo
需求人群 用户可以在视频制作、教育领域、有声书制作、播客等场景中使用Speechimo,为自己的内容注入高质量的人声。 使用场景 视频制作:用户可以使用Speechimo为自己的YouTube视频添加专业的人声配音,提升视频质量。 教育领域:老师可以利用Speechimo为在线教学视频生成生动有趣的人声,提高学生的学习兴趣。 播客制作:播客制作者可以使用Speechimo为节目添加生动的人声,吸引听众。 产品特色 为视频、演示文稿等内容生成逼真的人声 在几秒钟内生成专业级别的配音 节省大量资金,不再需要聘请昂贵的配音员 提高项目的生产力和效率
WhisperWizard
需求人群 适用于个人、商务等用户,特别适合需要频繁进行文字输入的用户,如写作、邮件撰写、翻译等。 使用场景 在家办公时,使用WhisperWizard将口头想法快速转化为文字文档。 商务会议上,使用WhisperWizard记录重要讨论内容。 外出时,使用WhisperWizard捕捉灵感,避免遗忘重要想法。 产品特色 智能语音转文字 自定义模板 AI转录增强口头语言 一键检索旧录音 多种定价计划
GPT-SoVITS
需求人群 用户可以用于语音转换、语音合成、语音处理等场景。 使用场景 用户可以通过输入5秒的声音样本,即可体验即时的文本到语音转换 用户可以通过仅使用1分钟的训练数据对模型进行微调,以提高语音相似度和逼真度 用户可以进行不同于训练数据集的语言推断,目前支持英语、日语和中文 产品特色 零样本TTS 少样本TTS 跨语言支持 WebUI工具
FreGrad
需求人群 FreGrad可用于音频生成、语音合成等场景。 使用场景 音频生成模型训练 语音合成应用 音频处理插件 产品特色 离散小波变换 频率感知扩张卷积 生成质量增强技巧
Bliss Brain
需求人群 Bliss Brain 适用于那些希望提高注意力、减轻压力和改善睡眠质量的用户。 产品特色 根据个人需求创建定制冥想 选择不同的目标和声音 提供多种冥想时长选择
AI Audio Kit
需求人群 AI Audio Kit适用于任何需要音频转录的场景,如会议记录、采访记录、学习笔记等。 产品特色 使用Whisper API进行精确音频转录 一键录音和转录 支持长文本摘要 转录历史记录 简单易用的界面
Whisper Speech
需求人群 适用于开发者和研究人员,用于构建自定义的文本转语音解决方案。 使用场景 开发者使用Whisper Speech构建多语言文本转语音应用 研究人员利用Whisper Speech进行语音合成实验 学生团队使用Whisper Speech开发个性化的语音应用 产品特色 支持多种语言 多种形式的输入 高效的语音合成 灵活的部署方式
Peech App
需求人群 个人使用场景:有阅读障碍、注意力不集中、视觉障碍,或只想听而不想读的人士 出版商使用场景:将教科书、网络小说、粉丝小说等转换为有声读物,吸引更多的读者 使用场景 个人使用示例:将网上文章转换为有声读物,随时随地倾听 个人使用示例:帮助有阅读障碍的人士更轻松地学习 出版商使用示例:将网络小说转换为有声读物,吸引更多读者 产品特色 将任何文本转换为音频 多语言支持 智能选择合适的语音角色 支持多种输入格式 分析内容选择合适的语音 适用于个人和出版商
Gotalk.ai
需求人群 适用于生成逼真的语音,可用于各种应用场景,包括视频制作、广播、电话系统等。 产品特色 快速生成逼真的 AI 语音 适用于 YouTube、播客和电话系统问候语 先进的 AI 算法和深度学习技术 自然语音合成
LID
需求人群 个人日志、心理健康、自我反思 产品特色 将口头日志转化为个性化的音频片段 提供情绪和经历的反馈 帮助形成健康的习惯 安全、私密的空间
啤啤熊
需求人群 该产品适用于需要使用AI技术和服务的个人用户、创业者及中小企业。可以用来提升工作效率,创造更多业务价值。 使用场景 用户可以通过语音命令,让啤啤熊帮助撰写简单的邮件 用户可以将打印体文字上传至啤啤熊,进行OCR识别转换为电子文本 用户可以让啤啤熊自动为文章生成关键词标签 产品特色 语音识别 语音合成 文本生成 图像处理 智能问答 语义理解
米可智能
需求人群 跨境市场营销、教育、媒体 产品特色 语音翻译 音色定制 语音合成
VoiceDrop.ai
需求人群 VoiceDrop.Ai适用于个性化沟通、市场营销、客户关系管理等场景。 产品特色 声音克隆技术 定制声音消息 实时监测和分析 全美覆盖 优质客户服务
Chat GPT voice
需求人群 适用于需要通过语音与GPT聊天进行交流的场景。 使用场景 通过语音与GPT聊天机器人进行对话 将GPT聊天输出转换为语音,方便人们进行听取 使用语音输入与GPT聊天进行互动 产品特色 将GPT聊天输出转换为语音 使用语音与GPT聊天进行交互
WhisperFusion
需求人群 用户可以通过使用预构建的TensorRT-LLM Docker容器快速开始与WhisperFusion进行交互。同时,也可以构建适用于不同cuda架构的docker镜像。 使用场景 1. 在网站上与WhisperFusion的AI进行实时对话 2. 通过WhisperFusion的小程序进行语音转文字交互 3. 使用WhisperFusion插件在桌面客户端上进行实时语音识别 产品特色 实时语音转文字:利用OpenAI WhisperLive实现实时语音转文字。 大型语言模型集成:整合Mistral大型语言模型,增强对转录文本的理解和语境。 TensorRT优化:LLM和Whisper均优化为TensorRT引擎,确保高性能和低延迟处理。 torch.compile:WhisperSpeech使用torch.compile来加速推断,通过将PyTorch代码即时编译为优化内核,使PyTorch代码运行更快。
WhisperKit
需求人群 WhisperKit可用于自动语音识别模型的性能优化和压缩,适用于需要在生产环境中部署自动语音识别模型的开发者和企业。 使用场景 企业A使用WhisperKit对其自动语音识别模型进行了压缩与优化,提高了系统性能。 开发者B利用WhisperKit对自己的自动语音识别模型进行了本地复现测试,获得了令人满意的结果。 团队C使用WhisperKit的质量保证认证功能,确保了其自动语音识别模型在不同数据集上的稳定性。 产品特色 自动语音识别模型的压缩与优化 性能评估数据提供 质量保证认证支持 本地复现测试结果
Felo Translator
需求人群 国际旅行、国际会议、语言学习、口语练习 产品特色 支持超过13种语言的同声翻译 自动识别会话语言并保存翻译内容 可选择女性或男性的翻译音频
AI Phone
需求人群 AI Phone适用于各种电话通话场景,包括商务电话、私人电话和工作电话等。它可以帮助用户更好地理解和记录通话内容,同时提供了多种辅助功能,如自动回复和消息建议,减轻了沟通的压力。 产品特色 实时电话转录 自动生成摘要 关键词提取 获取真实美国电话号码 自动回复消息 消息建议
MusicFX
需求人群 该产品适用于有音乐创作兴趣的用户,也可用于教育机构培养学生的音乐创作能力。通过简单的操作就可以创作属于自己的原创音乐,是个人或组织开展音乐创作活动的好平台。 使用场景 小明使用MusicFX创作了一首轻快的钢琴曲 音乐教师使用MusicFX平台指导学生创作作品 公司员工利用MusicFX平台共同创作了主题曲 产品特色 丰富的音效库 音乐创作工具 支持拖拽组合创作 可在线分享作品
Luvvoice
需求人群 Luvvoice适用于个人和商业用户,可用于生成有声读物、语音助手、视频制作等场景。 使用场景 将英文文章转化为有声读物 为视频添加自定义语音 开发智能语音助手 产品特色 提供200多种语音选择 支持多种语言 高质量的声音合成
VoicBot, AI Chatbot with ultra Realistic Voice
需求人群 适用于需要将语音内容转换为文字的场景,包括会议记录、语音转写、语音搜索等 产品特色 快速将语音内容转换为文字 支持多种语言和音频格式 提供准确的识别结果 适用于会议记录、语音转写、语音搜索等场景 用户友好的界面和简单易用的操作
Image to Music V2
需求人群 适用于内容创作者,可用于视频背景音乐、广告配乐等场景。 使用场景 上传一张风景图并生成宁静的背景音乐。 使用提示词生成激动人心的配乐,应用于创意广告。 为视频中的不同场景上传图像,获得与情感相符的音乐效果。 产品特色 图像转音乐生成 灵感和可能性拓展 简单图像上传和提示词生成
Wondera
需求人群 用于个人娱乐、音乐创作、演唱练习等场景 使用场景 用WONDERA演唱你喜欢的歌曲 让你的AI声音与其他用户的AI声音互动创作 在社区中展示你的AI声音,赚取版税 产品特色 通过演唱更多的歌曲,提升你的AI声音 AI声音可以演唱任何歌曲,就像一位明星 无限探索声音的可能性
Stability AI text-to-speech models
需求人群 适用于需要控制语音合成模型的说话者身份、风格和录音条件的用户。 使用场景 用户A想要生成一个具有美国口音的女性声音进行播报 用户B需要一个带有英国口音的男性声音进行录音 用户C想要一个带有南非口音的男性声音进行播报 产品特色 通过自然语言指导实现高保真文本转语音 标注不同的说话者身份、风格和录音条件 提供45000小时的数据集进行训练 提出简单方法提高音频保真度
celebrity ai voice generator
需求人群 可以用于个人娱乐、教育、广告等多种场景。 产品特色 通过名人的声音样本生成相应的语音 可以用于个人娱乐、教育、广告等多种场景 免费使用,简单方便
Paka AI
需求人群 适用于各种商业场景,包括客户服务、销售等 产品特色 接听客户电话 提供信息 电话转接
CREA de XMetaverso
需求人群 广告、博客、社交媒体等场景 产品特色 生成文章 改进内容 博客写作 广告创作 语音合成
BASE TTS
需求人群 ["语音合成","语音助手","有声读物生成","视障人士辅助"] 使用场景 将输入的文本转换为逼真的语音 为有声书自动生成配音 为语音助手赋予更自然的语调 为视障人士朗读文字 产品特色 文本到语音转换 10亿参数自动回归转换器 语音编码技术 处理长句子的语调能力
AI/ML API
需求人群 适用于各种场景,包括聊天、语音、图像等 使用场景 使用aimlapi.com创建一个智能聊天机器人 使用aimlapi.com将语音转换为文字 使用aimlapi.com生成逼真的图像 产品特色 访问100个AI模型 低延迟 24/7可访问 与OpenAI兼容 节省高达80%的成本 支持高级LLM、语音转文字、文字转语音、聊天机器人和图像生成等功能
ttsMP3.com
需求人群 适用于电子学习、演示、YouTube视频以及提高网站的可访问性等场景。 产品特色 将文本转换为自然流利的语音 支持多达28种以上的语言和口音 可在线收听或下载为MP3文件
Any GPT
需求人群 ["进行多模态聊天","支持语音助手等应用","创作多模态内容"] 产品特色 支持语音、文本、图像和音乐多种模态的输入和输出 可以进行多轮多模态交织的对话 在各个模态上都能达到专用模型的水平
VisFusion
需求人群 ["电影制作","游戏开发","虚拟现实"] 使用场景 电影制作中,用于创建逼真的虚拟场景 游戏开发中,快速构建游戏环境 虚拟现实中,生成交互式3D内容 产品特色 实时3D场景重建 视频数据解析 深度学习优化
PixelPlayer
需求人群 ["进行无监督的音频视觉分离","分析视听关系"] 使用场景 PixelPlayer可用于分离混合音频中的不同乐器声音。 PixelPlayer可用于研究视觉和听觉感知之间的关系。 PixelPlayer可用于探索不同像素区域对总体听觉体验的贡献。 产品特色 音频视觉源分离与定位 将声音信号分离成表示每个像素声音的组件 为输入视频的每个像素分配不同的音频波形
REECHO 睿声
需求人群 个人语音创作者、语音表演者、游戏角色配音、虚拟角色配音、有声读物配音 使用场景 小明收集了某演员的语音样本,使用该平台生成了虚拟角色的配音 李思录制了一批广播稿,使用语音合成功能生成了完整的广播片段 用户可以上传自己的语音,转换生成偶像歌手的声音,实现语音趣味化 产品特色 上传语音样本进行语音克隆 调整生成语音的参数,自定义语音风格 语音合成,支持上传文本进行 AI 语音合成 发布和分享 AI 语音作品
AV-HuBERT
需求人群 ["音视觉语音识别研究","自动语音识别系统开发","多模态数据聚类分析"] 使用场景 研究人员使用AV-HuBERT框架进行音视觉语音识别的实验研究 开发者利用AV-HuBERT模型开发能够理解不同语言环境下的语音识别应用 教育工作者使用AV-HuBERT辅助开发语言学习工具,提高学生的语言理解能力 产品特色 音视觉语音表示学习 掩蔽多模态聚类预测 自监督学习 唇读、ASR和音视觉语音识别
MeloTTS
需求人群 ["多语言语音合成","语音助手开发","教育和学习辅助"] 使用场景 开发者使用MeloTTS为多语言应用提供语音合成功能 教育软件利用MeloTTS为学习材料生成不同语言的语音 游戏开发者集成MeloTTS,为游戏角色提供多种语言的配音 产品特色 多语言文本转语音 实时CPU推理 开源社区支持
GhostMeet
需求人群 GhostMeet适用于任何需要组织会议的场景,包括企业内部会议、团队会议、客户会议等。 使用场景 企业内部团队会议 客户沟通会议 团队远程协作 产品特色 Ghost Links - 通过Ghost Links进行会议目的明确和会议准备 Trust Budgets - 使用Trust Budgets进行会议审批和资源分配 AI Integration - 集成人工智能AI进行智能分析,确保会议与组织目标一致 User Friendly Interface - 提供简单直观的界面,轻松管理会议 Security Measures - 提供安全性措施,保护敏感会议信息
Adobe Project Music GenAI Control
需求人群 ["广播和播客制作","电影和视频配乐","广告和营销音频创作"] 使用场景 广播制作人使用Project Music GenAI Control根据节目风格生成背景音乐 电影配乐师利用该工具快速创建电影预告片的背景音乐 广告创意团队通过该工具为广告制作定制的音效和背景音乐 产品特色 从文本提示生成音乐 精细控制音频编辑 调整音乐节奏、结构和重复模式 生成无缝循环的音乐片段
Bon French
需求人群 适用于初学法语者的日常学习和练习,提供多种辅助功能和语言学习资源。 产品特色 AI 法语句子分析 语音朗读功能 单词本和句子收藏夹 AI 法语老师快速响应
Narakeet
需求人群 视频制作、广告旁白、教育内容制作 使用场景 视频制作人使用Narakeet为宣传视频添加旁白。 教育工作者创建有声读物,提高学生阅读兴趣。 广告公司制作广告旁白,提升广告效果。 产品特色 文本转语音 旁白视频制作 多种语言和声音选择 自定义音量和速度 支持多种文件格式
Ewolve AI
需求人群 适用于数字机构、产品设计师、企业家、文案写手、数字营销人员、开发者等 产品特色 AI文本生成 AI图像生成 AI聊天机器人 AI转换YouTube链接为博客等 AI语音转文字
DeepBrain AI
需求人群 适用于内容创作者、设计师、开发者等,需要利用AI技术进行创作和编辑的用户。 使用场景 使用AI工具生成艺术作品 编辑和优化视频内容 创作音乐和声音效果 产品特色 AI项目管理 图像和视频创作 音频处理 AI工具集成
NaturalSpeech 3
需求人群 适用于需要高质量、高相似性和良好韵律的语音合成的研究和应用,例如文本到语音转换、虚拟助手和语音识别系统。 使用场景 在文本到语音转换任务中使用NaturalSpeech 3生成自然流畅的语音 利用NaturalSpeech 3的属性操作功能调整语音的持续时间、韵律和音色 在语音识别系统中集成NaturalSpeech 3以提高语音的可理解性和质量 产品特色 零样本语音合成 使用分解编解码器和扩散模型 解耦语音波形以生成不同属性的子空间
iListen
需求人群 适用于需要快速获取知识的用户,可在不同场景下进行学习。 使用场景 在上班途中听取网页文章摘要 在运动时学习文章关键内容 在休闲时轻松吸收知识 产品特色 将文章转化为音频摘要 个性化选择语音和摘要长度 轻松学习,随时随地享受 帮助记忆关键要点
Earthworm
需求人群 适用于希望通过互动方式提高英语水平的学习者。 使用场景 使用Earthworm进行日常英语练习 通过Earthworm的语音功能提高发音准确性 利用Earthworm的重置功能重复练习直至掌握 产品特色 互动式英语学习 语音播报和输入验证 用户自定义设置
千秋诗颂
需求人群 观赏中国古诗词改编的国风动画,了解历史和文化 使用场景 观看《千秋诗颂》中文版动画 欣赏AI技术制作的国风动画 体验AI语言模型翻译配音 产品特色 使用 AIGC 技术制作国风动画 AI 技术翻译配音 增加历史背景介绍和人物身份注释