定位:不只转写,还要「听懂」
官网的标题是「用于转写与理解语音的 AI 模型」,并把平台按用途分成四组:transcribe(预录制、实时与同步识别)、understand(语音理解、安全护栏与模型网关)、interact(语音智能体与听写接口)、inference(自托管与云端推理)。这四组共用同一套账号与密钥,产品边界是按「音频进来之后要做什么」划分的,而不是按技术模块。官网给出的语言覆盖是 99 种,并列出 Zoom 等企业客户的公开案例,其中一家客服产品称把投诉与工单量降低了九成。
深度介绍
官网的标题是「用于转写与理解语音的 AI 模型」,并把平台按用途分成四组:transcribe(预录制、实时与同步识别)、understand(语音理解、安全护栏与模型网关)、interact(语音智能体与听写接口)、inference(自托管与云端推理)。这四组共用同一套账号与密钥,产品边界是按「音频进来之后要做什么」划分的,而不是按技术模块。官网给出的语言覆盖是 99 种,并列出 Zoom 等企业客户的公开案例,其中一家客服产品称把投诉与工单量降低了九成。
预录制识别当前有两个主力模型。Universal-3.5 Pro 被官方描述为「最准确的异步语音识别模型,把每段对话按其被听到的样子转写」,覆盖 18 种语言、支持原生语码切换,并称拥有目前最准确的说话人分离,价格为每小时 0.21 美元;Universal-2 基于超过 1,250 万小时音频训练,覆盖 99 种语言,定位是「以更低价格提供出色准确率」,价格为每小时 0.15 美元。选型时可以在自有语料上同时跑两个模型,比较错字率与每小时成本后再决定。
实时侧的主力是 Universal-3.5 Pro Realtime,官方强调它内置上下文延续与对话记忆,支持 18 种语言,并具备自我校正的说话人标签、语音隔离与关键词提示,价格为每小时 0.45 美元;另有 Universal-Streaming 面向仅英语的高质量实时转写,主打低延迟与成本,价格为每小时 0.15 美元,并提供多语言版本。实时场景里「上下文能否延续」往往比单句准确率更影响体验,因为同一句话在不同对话阶段含义不同。
Dictation API 面向的是输入类场景:一次调用返回两样东西——整理后的文本与逐字稿。整理内容包括去掉口头语、把自我更正解析成说话人最终想表达的版本、补上标点与大小写,并把专有名词按用户习惯的拼写输出;默认即开启整理,无需配置。它基于 Universal-3.5 Pro,覆盖 32 种语言,单次最多接受 120 秒音频,并支持边录边传;如果需要特定形态的输出(例如待办清单或临床记录),可以通过指令参数指定。
Speech Understanding 提供一组分析能力:行动项、自动章节、自定义格式、实体识别、关键短语、逐句情感分析、说话人识别、摘要、主题检测与翻译。它们建立在转写结果之上,因此转写质量会直接影响下游分析的可靠性——实践中通常先用关键词提示或提示词提升专有名词准确率,再开启理解能力。对会议记录、客服质检与内容归档类产品,这些能力可以直接替代一部分自研的后处理逻辑。
interact 一组包含语音智能体接口与听写接口,understand 一组则包含安全护栏与模型网关。官方文档说明语音智能体接口用于把对话能力接入产品,护栏与网关用于约束模型行为、管理模型调用与路由。对已经自建智能体框架的团队,这部分的价值在于省掉自研的对话编排与风控;如果已有成熟框架,也可以只取识别与理解两块能力,把智能体层留在自己手里。
官网把 inference 单列为一组,提供自托管与云端推理(Voice AI Cloud)两种形态;文档另设云端点与数据驻留、连接预热等章节,说明它面向对时延与数据位置有要求的企业场景。对医疗、金融等受监管行业,能否自托管、数据落在哪个区域、是否有安全与合规材料,往往比模型指标更决定方案能否落地;建议在选型早期就确认这些约束,而不是等集成完成后再补。
价格页的规则是「先免费试用,之后按量计费,无需承诺」。基础转写按时长计价,模型不同价格不同;此外还有按小时另计的附加功能:关键词提示在 Universal-3.5 Pro 上为每小时 0.05 美元、在 Universal-2 上已包含,自然语言提示为每小时 0.05 美元,说话人分离为每小时 0.02 美元(异步)与 0.12 美元(实时),医疗模式为每小时 0.15 美元。也就是说同一条音频的实际单价取决于启用了哪些能力,预算模型需要把它们一起算进去。
产品特点
转写接口之外,还提供行动项、自动章节、实体识别、关键短语、情感分析、说话人识别、摘要、主题检测与翻译等理解能力,省掉自研后处理的一层工作量。
异步侧有 Universal-3.5 Pro(18 种语言、强调语码切换与说话人分离,每小时 0.21 美元)与 Universal-2(99 种语言、每小时 0.15 美元);实时侧有带上下文延续与对话记忆的 Universal-3.5 Pro Realtime 与低成本的 Universal-Streaming。
一次调用同时返回整理后的文本与逐字稿:去口头语、解析自我更正、补齐标点与大小写、按用户习惯输出专名拼写,并可用指令参数定制输出形态,单次最长 120 秒音频。
除云端接口外提供自托管部署与云端推理两种形态,文档中包含云端点与数据驻留、连接预热等企业关注项,适合对数据位置与合规有硬性要求的行业。
最近动态
官网当前把 Dictation API 标注为最新发布,称其为「第一个为听写打造的接口」:用户说话后返回可直接发送的文本,去口头语、解析自我更正、并按用户习惯拼写专名;文档显示它基于 Universal-3.5 Pro、覆盖 32 种语言、单次最长 120 秒。
文档站头部标注「Universal-3.5 Pro 已上线」并给出异步与实时两个入口。异步版价格为每小时 0.21 美元,实时版为每小时 0.45 美元并内置上下文延续、对话记忆、自我校正说话人标签与语音隔离。
价格页当前列出的异步模型为 Universal-3.5 Pro(0.21 美元/小时)与 Universal-2(0.15 美元/小时),实时模型为 Universal-3.5 Pro Realtime(0.45 美元/小时)与 Universal-Streaming(0.15 美元/小时);附加功能按小时另计,包括关键词提示、自然语言提示、说话人分离与医疗模式。
官网当前把能力分为 transcribe、understand、interact 与 inference 四组,涵盖预录制、实时与同步识别、语音理解、安全护栏、模型网关、语音智能体、听写、自托管与云端推理,语言覆盖标称为 99 种。
AssemblyAI 是一个语音 AI 模型平台,官网的定位是「用于转写与理解语音的 AI 模型」。它把能力分成四组:transcribe(预录制、实时与同步识别)、understand(语音理解、安全护栏与模型网关)、interact(语音智能体与听写接口)与 inference(自托管与云端推理),覆盖 99 种语言,并列出 Zoom 等企业客户的公开案例。 转写模型按准确率与价格分档。异步侧,Universal-3.5 Pro 被描述为最准确的异步模型,覆盖 18 种语言、支持原生语码切换与更准的说话人分离,价格为每小时 0.21 美元;Universal-2 基于超过 1,250 万小时音频训练、覆盖 99 种语言,价格为每小时 0.15 美元。实时侧,Universal-3.5 Pro Realtime 内置上下文延续与对话记忆,支持 18 种语言、自我校正说话人标签、语音隔离与关键词提示,价格为每小时 0.45 美元;Universal-Streaming 面向仅英语的高质量实时转写,主打低延迟与成本,价格为每小时 0.15 美元。 除转写外,平台还有两块特色能力。听写接口(Dictation API)一次调用返回整理后的文本与逐字稿:去口头语、解析自我更正、补齐标点与大小写,并按用户习惯输出专名拼写,基于 Universal-3.5 Pro、覆盖 32 种语言、单次最长 120 秒,还支持边录边传与用指令参数定制输出形态。语音理解侧提供行动项、自动章节、自定义格式、实体识别、关键短语、逐句情感、说话人识别、摘要、主题检测与翻译,可用于会议记录、客服质检与内容归档。 部署与计费上,官网提供自托管与云端推理两种形态,文档中包含云端点与数据驻留、连接预热等企业项。计费规则是「先免费试用,之后按量计费,无需承诺」,基础转写按时长计价,附加功能按小时另计:关键词提示每小时 0.05 美元(在 Universal-2 上已包含)、自然语言提示每小时 0.05 美元、说话人分离每小时 0.02 美元(异步)与 0.12 美元(实时)、医疗模式每小时 0.15 美元。由于同一条音频的实际单价取决于启用了哪些能力,预算时应把附加项一并计入;模型准确率与价格也会随版本调整,请以官网当期说明为准。
核验信息
本页事实来自 AssemblyAI 官方渠道:官网首页(转写并理解语音的定位、四组产品线划分、99 种语言与客户案例)、价格页(异步与实时模型的每小时价格、附加功能单价与「先免费试用后按量计费」规则)、官方文档(听写接口的返回内容、语言与时长限制、整理与指令参数说明;语音理解的行动项、章节、实体、情感、摘要等能力清单;云端点、数据驻留与连接预热等企业项),以及 Universal-3.5 Pro Realtime 的官方发布说明与基准测试页面。价格与模型信息核验于 2026 年 9 月 22 日,请以官方当期说明为准。
AssemblyAI介绍页面对您是否有帮助?