Civilization Museum
The Dark Forest
目录
0%
摘要
1 引言
2 相关工作
2.1 多任务音频-文本学习
2.2 多模态与大语言模型交互
3 方法
3.1 模型架构
3.1.1 音频编码器
3.1.2 大语言模型
3.2 多任务预训练
3.2.1 多任务训练格式框架
3.3 监督微调
4 实验
4.1 实验设置
4.2 评估方案
4.3 主要结果
4.5 词级时间戳预测任务分析
0%