登录
软件下载
帮助文档
新闻资讯
Skill UI
浏览并发现
15857+
精选技能
全部
编程开发
人工智能
设计创意
产品商业
数据科学
市场营销
职场通用
效率工具
硬件工程
语言学习
搜索
语音AI
,共找到
118
条记录
默认排序
最新上传
最多下载
Azure AI语音转录服务SDK
azure-ai-transcription-py
sickn33/antigravity-awesome-skills
480
这是一个基于Python的Azure AI语音转写SDK。它支持实时流式和批处理两种模式的语音转文本功能。该工具可以实现带时间戳和说话人区分(Diarization)的转录,适用于自动化会议记录、播客内容处理、视频字幕生成等专业场景。
查看详情
Azure AI语音转录服务SDK
azure-ai-transcription-py
sickn33/antigravity-awesome-skills
479
这是一个基于Python的Azure AI语音转写SDK。它支持实时流式和批处理两种模式的语音转文本功能。该工具可以实现带时间戳和说话人区分(Diarization)的转录,适用于自动化会议记录、播客内容处理、视频字幕生成等专业场景。
查看详情
Azure AI 语音实时交互开发套件
azure-ai-voicelive-dotnet
sickn33/antigravity-awesome-skills
312
该SDK专为.NET开发者设计,用于构建实时的双向语音AI应用。它支持通过WebSocket进行通信,能够处理音频和文本流事件,并支持如函数调用等高级功能,是开发复杂虚拟助手和实时语音交互系统的理想工具。
查看详情
Azure AI实时语音对话SDK
azure-ai-voicelive-java
sickn33/antigravity-awesome-skills
63
这是一个用于Java开发的SDK,用于实现与Azure AI助手的实时、双向语音对话。它通过WebSocket技术支持低延迟流媒体通信,并集成了高级功能,如语音活动检测、降噪处理和多种AI音色选择。非常适用于构建专业的语音机器人和交互式语音应用。
查看详情
Azure 实时语音AI开发SDK
azure-ai-voicelive-py
sickn33/antigravity-awesome-skills
105
该SDK用于构建实时、双向的语音AI应用,通过WebSocket支持实时的语音流媒体通信。它允许开发者将麦克风音频输入模型,并接收合成语音输出。适用于开发智能语音助手、交互式语音系统和呼叫中心解决方案。
查看详情
Azure AI实时语音助理开发套件
azure-ai-voicelive-ts
sickn33/antigravity-awesome-skills
316
这是一个用于构建实时、双向语音AI应用的SDK。它通过WebSocket支持音视频流传输,能够处理用户语音输入、AI回复文本和音频流,并提供完整的会话管理功能。适用于在Node.js或浏览器环境中开发功能强大的语音助手和交互式AI代理。
查看详情
Azure语音转文本API
azure-speech-to-text-rest-py
sickn33/antigravity-awesome-skills
60
这是一个使用Python和REST API实现的Azure语音转文本功能。它允许用户通过HTTP请求,对时长不超过60秒的音频文件进行语音识别转录。该工具无需依赖官方SDK,适用于需要快速集成语音识别功能的开发场景,并支持分块传输以降低延迟。
查看详情
Deepgram实时流式语音转录
deepgram-core-workflow-b
jeremylongshore/claude-code-plugins-plus-skills
451
本指南展示了如何使用Deepgram的WebSocket API实现稳定、低延迟的实时流式语音转录。内容涵盖了麦克风输入采集、说话人指纹识别(diarization)、语句结束检测以及自动重连机制。适用于构建专业的语音助手、直播字幕系统或实时语音AI应用。
查看详情
Deepgram 转录服务迁移指南
deepgram-migration-deep-dive
jeremylongshore/claude-code-plugins-plus-skills
449
本指南详细介绍了从多个主流语音转录服务提供商(如 AWS Transcribe、Google STT、Whisper 等)迁移到 Deepgram 的流程。它提供了全面的功能对标和适配器模式实现,帮助开发者平稳、可靠地切换转录服务,确保项目连续性和数据完整性。
查看详情
Deepgram可扩展语音转录架构
deepgram-reference-architecture
jeremylongshore/claude-code-plugins-plus-skills
488
本模块提供了基于Deepgram的可扩展转录系统参考架构。涵盖了同步REST(短文件)、异步队列(批量处理)、WebSocket实时流媒体和混合路由器等四种主流模式,指导开发者根据不同的音频工作负载选择最合适的系统架构。
查看详情
Deepgram SDK升级与迁移指南
deepgram-upgrade-migration
jeremylongshore/claude-code-plugins-plus-skills
365
本指南为开发者提供了Deepgram SDK从旧版本(v3/v4)迁移到新版本(v5)的完整路线图。它详细介绍了版本升级的破坏性变更,包括API对比和最佳实践代码,并指导用户完成模型从Nova-2到Nova-3的升级,确保语音识别和文本合成流程的平稳过渡。
查看详情
文本语音音频处理
fal-audio
sickn33/antigravity-awesome-skills
83
本技能利用fal.ai模型提供双向音频处理能力。它支持文本转语音(TTS),将文字转换为自然语音;以及语音转文本(STT),将语音准确转录为文字。适用于需要处理音频输入分析或合成语音输出的场景,如语音助手、内容数字化或多语言应用。
查看详情
1
2
3
4
...
8
9
10
下一页
语言
简体中文
English