PrismAudio – 阿里通义推出的视频生成音频框架

PrismAudio 是阿里通义实验室推出的视频生成音频(Video-to-Audio)框架,可为无声视频自动配上环境音效。模型首创"分解式思维链"技术,让模型先思考声音内容、时机、质感、空间位置,再生成音频,引入四位"老师"(语义、时序、美学、空间)多维打分优化。

新闻资讯 2026-05-12 PPISO
2 0

文章摘要

PrismAudio 是阿里通义实验室推出的视频生成音频(Video-to-Audio)框架,可为无声视频自动配上环境音效。模型首创"分解式思维链"技术,让模型先思考声音内容、时机、质感、空间位置,再生成音频,引入四位"老师"(语义、时序、美学、空间)多维打分优化。

特别声明

本文内容由 PPISO 编辑整理发布,仅作为工具选择、资料整理与效率实践参考。涉及第三方网站功能、价格和服务条款时,请以对应官方网站信息为准。

原文链接:http://ainav.ppiso.com/xwzx/331.html

本文标签

这篇文章暂未设置标签。

相关阅读

暂无相关阅读。

评论交流

暂无评论,欢迎留下你的看法。