德他数据 / API 教程

语音合成:文本准备与音频交付设计

介绍语音合成中的文本规范化、分段、音色与授权、音频格式和验收,明确德他音频 API 当前未开放。

作者:德他数据技术团队 · 更新于 2026-09-24

核心解答

语音合成接入先确定文本、语言、音色、交付格式和授权范围,再核实分段与计费规则。德他当前没有开放 TTS 或音频流式接口;不能向现有文本对话接口添加音频字段实现语音生成。

阅读范围与当前状态

本篇为完整的协议说明或接入准备指南,不代表所述原生、视频或扩展能力已在德他开放。真实调用以接口开放范围和具体模型的核准状态为准。

把朗读文本与展示文本分开

网页可读的文字不一定适合直接朗读。应处理标题、链接、特殊符号和不应播报的说明。数字、缩写和产品名称需要单独检查读法;不要把未经审核的用户内容直接用于自动对外播报。

需求清单

| 项目 | 应明确的内容 |

| --- | --- |

| 语言与语气 | 服务场景、目标受众和表达风格 |

| 音色 | 可用音色及其使用授权 |

| 文本长度 | 分段方式、段间停顿和拼接顺序 |

| 交付格式 | 播放器支持的编码、采样与容器 |

| 延迟要求 | 整段交付或实时播放需求 |

| 计费单位 | 按具体方案确认,不默认按 Token |

长文本处理

按语义段落拆分,保留段落序号与原文版本,避免重试后拼接错序。对每段记录生成结果与处理结论;只有明确失败且允许重新执行时才重试。客户端停止播放不代表远端合成已取消。

质量与授权验收

检查漏字、多音字、停顿、音量与尾部截断。使用真人相关音色时必须取得适用授权,不能把品牌音色或他人声音视为可自由复制的素材。交付前检查生成内容是否符合业务用途。

德他当前能力边界

TTS、语音克隆、音频上传和音频流式输出均未通过本教程声明开放。当前文本与同步图片接口不能替代音频专用接口;本篇不提供看似可运行的音频请求路径。

常见问题

文字聊天模型返回语音描述就等于音频吗?

不是,文字描述与实际音频数据不同。

字数与音频时长可以直接换算计费吗?

不能作为结算依据。应使用所选产品明确的单位和实际核验结果。

接口开放范围 · 密钥与上线检查

关联文档:德他数据教程。本文按德他实际功能独立编写。