2025 科大讯飞 1024 开发者节上,两大 AI 创新成果惊艳亮相:多模态数字人 “小飞” 正式上岗,以八项核心能力打造 “类人” 服务体验;业界首发的 “百变声音复刻” 技术,仅凭一句话即可高保真复制音色,为声音创作领域带来革命性突破,标志着 AI 交互正从 “能用” 向 “有温度、个性化” 全面升级。
多模态数字人 “小飞”:从工具到 “类人” 伙伴的跨越
已实际投入服务的数字人导览 “小飞”,彻底打破了传统数字人简单问答的局限,成为能深度融入真实物理空间的智能伙伴。其核心优势集中体现在三大维度:
在交互能力上,“小飞” 支持多人自由对话场景,无需固定轮流问答模式,可精准捕捉多用户同时发起的需求并逐一回应。依托强大的多语种处理能力,它能流畅完成中英日韩等 10 余种语言的实时交流,还能保留方言口音特色,消除跨语言沟通障碍。更具亮点的是其个性化记忆功能,能主动记录访客历史咨询信息、偏好设置等内容,后续互动时提供针对性提醒与服务。
在呈现形式上,“小飞” 实现了虚拟形象的秒级切换,既能以专业导览员形象提供标准化服务,也能化身 “林黛玉” 等经典角色,为文旅讲解、展厅互动等场景增添趣味性与沉浸感。这种灵活的形象适配能力,让智能服务不再局限于单一风格,可满足不同场景的氛围需求。
科大讯飞董事长刘庆峰介绍,“小飞” 的核心突破源于远场识别、3D 视觉感知、情感语义理解等八项核心技术的深度融合。它不仅能听懂用户指令,还能通过表情、肢体动作传递情感,实现 “面对面” 的多模态互动,让 AI 服务从冰冷的功能输出,转变为有温度、有深度的人性化陪伴。
“百变声音复刻” 技术:一句话解锁声音创作自由
同步发布的 “百变声音复刻” 技术,基于科大讯飞星火语音大模型研发,创下业界 “最短样本、最高保真” 的双重突破。用户只需录制一句话的音频样本,系统便能快速提取音色、语调、情感等核心特征,高保真复刻出专属声线,情感还原度高达 92%,声音误差控制在 50 毫秒以内。
这项技术的创新之处在于 “复刻 + 创作” 的双重能力。完成音色复刻后,用户通过一条指令即可让复刻声音切换任意风格 —— 既可以生成温柔的睡前故事语调,也能模拟激昂的演讲语气,甚至支持添加笑声、停顿等细节标签,实现语气的动态调节。其跨语言适配能力同样突出,可支持中英日韩等多语种混合生成,为跨文化内容创作提供便利。
从应用场景来看,“百变声音复刻” 技术将重构多个行业生态。在数字人领域,可快速为虚拟主播、数字员工定制专属声线,解决当前数字人声音同质化问题;在内容创作领域,有声读物作者、自媒体创作者无需专业录音设备,就能生成个性化配音,大幅降低制作成本;在消费电子领域,还可应用于手机语音助手、智能音箱等设备,让用户拥有专属交互声音。
技术落地:连接大模型与真实场景的桥梁
无论是多模态数字人 “小飞”,还是 “百变声音复刻” 技术,本质上都是科大讯飞推动大模型场景化落地的重要探索。正如 AI 数字人一体机的行业实践所示,“软硬结合” 的解决方案能有效降低大模型部署门槛,让先进 AI 能力快速转化为可感知的服务体验。
“小飞” 已率先在展厅导览、政务服务咨询等场景上岗,其 “类人” 交互能力不仅提升了服务效率,更通过亲和力十足的沟通方式消除了技术距离感。而 “百变声音复刻” 技术的落地,将进一步丰富数字服务的个性化维度,让每个人都能拥有专属的 AI 交互标识。
未来,随着两项技术在更多场景的渗透,从文旅讲解、企业培训到客户服务、内容创作,AI 交互将迎来 “千人千面” 的新时代。科大讯飞通过技术创新,正持续搭建大模型与真实世界的连接桥梁,让智能服务真正融入生活的每一个角落。
免责声明:本文仅代表作者个人观点,与时尚科技网无关。其原创性以及文中陈述文字和内容未经本站证实,对本文以及其中全部或者部分内容、文字的真实性、完整性、及时性本站不作任何保证或承诺,请读者仅作参考,并请自行核实相关内容。
本网站有部分内容均转载自其它媒体,转载目的在于传递更多信息,并不代表本网赞同其观点和对其真实性负责,若因作品内容、知识产权、版权和其他问题,请及时提供相关证明等材料并与我们联系,本网站将在规定时间内给予删除等相关处理.

