序列猴子开放平台 - 出门问问大模型与语音API

序列猴子开放平台 - 出门问问大模型与语音API

aiapichinese
访问官网

序列猴子开放平台 - 出门问问大模型与语音API

序列猴子开放平台是出门问问(Mobvoi)面向开发者的大模型 API 平台,底层为自研序列猴子大模型——以长序列、多模态、单模型、大数据为特点的超大规模语言模型,支持多轮交互。平台把大模型文本生成、语音合成、声音克隆、数字人与视频译制等能力统一以 API 形式开放;出门问问是以 AI 语音起家的公司,C 端的配音产品魔音工坊同样出自其手。

功能速览

大模型文本生成

长序列、多模态的语言模型能力,支持多轮交互调用

语音合成

文本转语音接口,多种音色可选,适合配音与播报

声音克隆

用少量音频素材复刻目标音色,做专属声音

图片驱动数字人

一张照片驱动数字人口型与表情,生成数字人视频

视频配音

为视频内容自动配音,创作流程一体化

视频翻译

视频内容的跨语言译制,面向出海与本地化

功能详解

平台的能力分三层:语言模型层负责理解与生成,语音层负责「说」,数字人与视频层负责「演」,层层叠加可以把一条内容从纯文本做成有声音、有形象的视频成品。

序列猴子大模型是平台的底座,具有长序列、多模态、单模型、大数据四个特点,基于通用的表示能力与推理能力对外提供文本生成 API;接口支持多轮交互,可嵌入对话系统、内容生产与办公自动化等场景,官方页面提供模型能力介绍与调用文档。

产品优势

出门问问自 2012 年起深耕 AI 语音,语音合成与声音克隆经过魔音工坊等 C 端产品的大规模验证,中文场景表现扎实;能力面覆盖文本、语音、数字人、视频四层,做内容生成类应用不必分别对接多家厂商;底层序列猴子大模型为自研,文本与语音能力可以组合编排;企业客户可选择专属模型的私有化部署,以 License 形式交付。

适用场景

人群 / 场景典型用法
配音与有声内容语音合成批量产有声书、播客,声音克隆做专属音色
短视频与直播图片驱动数字人做主播口播,视频配音补齐成片声音
内容出海视频翻译接口做多语言译制,一条内容多地区分发
应用开发者大模型 API 嵌入对话与内容生成流程,语音能力做交互

价格

平台接口按用量计费,不同能力的计费单位与单价以平台价格页为准;面向企业的专属大模型支持私有化部署,以 License 形式交付,华为云商店标价 50000 元起。

常见问题

序列猴子是出门问问自研的超大规模语言模型,特点概括为长序列、多模态、单模型、大数据;序列猴子开放平台则把它连同语音、数字人、视频等能力打包成 API 对外提供服务。