
序列猴子开放平台是出门问问(Mobvoi)面向开发者的大模型 API 平台,底层为自研序列猴子大模型——以长序列、多模态、单模型、大数据为特点的超大规模语言模型,支持多轮交互。平台把大模型文本生成、语音合成、声音克隆、数字人与视频译制等能力统一以 API 形式开放;出门问问是以 AI 语音起家的公司,C 端的配音产品魔音工坊同样出自其手。
功能速览
大模型文本生成
长序列、多模态的语言模型能力,支持多轮交互调用
语音合成
文本转语音接口,多种音色可选,适合配音与播报
声音克隆
用少量音频素材复刻目标音色,做专属声音
图片驱动数字人
一张照片驱动数字人口型与表情,生成数字人视频
视频配音
为视频内容自动配音,创作流程一体化
视频翻译
视频内容的跨语言译制,面向出海与本地化
功能详解
平台的能力分三层:语言模型层负责理解与生成,语音层负责「说」,数字人与视频层负责「演」,层层叠加可以把一条内容从纯文本做成有声音、有形象的视频成品。
序列猴子大模型是平台的底座,具有长序列、多模态、单模型、大数据四个特点,基于通用的表示能力与推理能力对外提供文本生成 API;接口支持多轮交互,可嵌入对话系统、内容生产与办公自动化等场景,官方页面提供模型能力介绍与调用文档。
产品优势
出门问问自 2012 年起深耕 AI 语音,语音合成与声音克隆经过魔音工坊等 C 端产品的大规模验证,中文场景表现扎实;能力面覆盖文本、语音、数字人、视频四层,做内容生成类应用不必分别对接多家厂商;底层序列猴子大模型为自研,文本与语音能力可以组合编排;企业客户可选择专属模型的私有化部署,以 License 形式交付。
适用场景
| 人群 / 场景 | 典型用法 |
|---|---|
| 配音与有声内容 | 语音合成批量产有声书、播客,声音克隆做专属音色 |
| 短视频与直播 | 图片驱动数字人做主播口播,视频配音补齐成片声音 |
| 内容出海 | 视频翻译接口做多语言译制,一条内容多地区分发 |
| 应用开发者 | 大模型 API 嵌入对话与内容生成流程,语音能力做交互 |
价格
平台接口按用量计费,不同能力的计费单位与单价以平台价格页为准;面向企业的专属大模型支持私有化部署,以 License 形式交付,华为云商店标价 50000 元起。
常见问题
序列猴子是出门问问自研的超大规模语言模型,特点概括为长序列、多模态、单模型、大数据;序列猴子开放平台则把它连同语音、数字人、视频等能力打包成 API 对外提供服务。