加载中...
开源语音识别引擎 · 私有化部署
基于开源语音识别引擎,私有化部署,无授权费用
6万小时语料训练,中文识别准确率98%+,CPU即可部署
提交录音文件URL,异步识别,回调返回结果。60秒录音10秒内出结果。
单双声道自动识别,差异化计费。支持MP3、WAV、PCM等主流格式。自动添加标点,输出带时间戳的逐字结果。
通话中实时推送识别结果,毫秒级响应,边说边出字。
双声道分离,逐句返回。内置语音活动检测,自动过滤静音段,只识别有效语音。
不只是语音转文字,内置完整的语音处理流水线
基于Paraformer非自回归架构,6万小时中文语料训练,220M参数量,标准测试集字错率低至1.95%,识别准确率98%+。
内置FSMN-VAD模型,自动检测音频中的有效语音段,过滤静音和噪音,输出每段语音的起止时间(毫秒级精度)。
CT-Transformer标点模型,1亿条样本训练,自动为识别文本添加标点符号,输出即可读,无需二次处理。
每个识别词条精确标注起始和结束时间,支持录音回放定位、字幕对齐等场景。
支持添加业务专属热词,提升人名、产品名、行业术语等特定词汇的识别准确率,无需重新训练模型。
内置CAM++说话人模型,支持说话人分离和验证,自动区分通话中不同说话人的内容。
非自回归架构比传统模型快12倍,CPU即可部署运行,无需GPU,单台服务器支撑多路并发识别。
VAD自动分段 + 流式拼接,不限音频时长,几分钟到几小时的录音都能处理,无需手动切分。
不只是转写,更是一套完整的语音识别运营平台
多台ASR服务器统一管理,最小队列优先算法自动分配任务,高峰期也不排队,任务失败自动重试到其他服务器。
持续巡检每台服务器状态,发现异常自动摘除并将任务转移到健康节点,超时任务自动重试,全程无需人工干预。
忙时/闲时差异定价,单双声道自动识别分别计费。支持透支额度、充值退款,账单清晰透明。
管理端统管全局,企业端自助查询用量和账单,代理商端独立管理下级客户。三个Web后台开箱即用。
开源引擎无授权费用,只需服务器硬件成本。CPU部署即可运行,不依赖GPU,量越大越划算。
每日统计、财务报表、请求报表一应俱全。服务器CPU/内存/队列实时监控,全链路可观测。