阿里开源语音合成工具CosyVoice 2,实时合成。
大模型(LLM)是一种人工智能模型,旨在理解和生成人类语言。它们在大量的文本数据上进行训练,可以执行广泛的任务,包括文本总结、翻译、情感分析等等。LLM的特点是规模庞大,包含数十亿的参数,帮助它们学习语言数据中的复杂模式。这些模型通常基于深度学习架构,如转化器,这有助于它们在各种NLP任务上取得令人印象深刻的表现。
2022年底,OpenAI 推出的基于 GPT-3.5 的大型语言模型 ChatGPT,由于其优秀的表现,ChatGPT 及其背后的大型语言模型迅速成为人工智能领域的热门话题,吸引了广大科研人员和开发者的关注和参与。

为了方便大家阅读,只列出了论文标题、AMiner AI综述等信息,如果感兴趣可点击查看原文,PC端数据同步(收藏即可在PC端查看),每日新论文也可登录小程序查看。
如果想要对某篇论文进行深入对话,可以直接复制论文链接到浏览器上或者直达AMiner AI页面:
https://www.aminer.cn/chat/g/explain
Parallelized Autoregressive Visual Generation
【要点】:本文提出了一种简单有效的并行化自回归视觉生成方法,通过识别视觉标记间的依赖关系,实现了在不损失模型优势的前提下提高生成效率。
【方法】:作者基于视觉标记的依赖性,开发了一种生成策略,能够并行生成依赖性弱的远端标记,同时保持强依赖性的局部标记按顺序生成。
【实验】:通过在ImageNet和UCF-101数据集上的实验,证明了该方法在图像和视频生成任务中,能够实现3.6倍的效率提升且保持图像质量,或在质量略有下降的情况下实现9.5倍的效率提升。
【链接】:https://www.aminer.cn/pub/6764e2ebae8580e7ffbaa9ec
Offline Reinforcement Learning for LLM Multi-Step Reasoning
【要点】:本文提出了一种名为OREO的离线强化学习方法,用于提高大型语言模型的多步推理能力,无需收集成对偏好数据,并能有效解决稀疏奖励问题。
【方法】:OREO基于最大熵强化学习,通过优化软贝尔曼方程同时学习策略模型和价值函数。
【实验】:本文在数学推理任务(GSM8K, MATH)和实体代理控制(ALFWorld)的基准测试中验证了OREO方法,结果显示该方法超越了现有的离线学习方法。
【链接】:https://www.aminer.cn/pub/6768d2afae8580e7ff5b364f
CLEAR: Conv-Like Linearization Revs Pre-Trained Diffusion Transformers Up
【要点】:本研究提出了一种名为CLEAR的卷积式局部注意力机制,成功将预训练的Diffusion Transformers (DiT) 复杂度降至线性,实现了高分辨率图像生成的加速和效率提升。
【方法】:通过分析现有高效注意力机制,确定四个关键因素,并基于这些因素提出CLEAR策略,限制每个查询令牌的特征交互至局部窗口内,实现线性复杂度。
【实验】:通过在10K自生成样本上对注意力层进行10K次迭代微调,将预训练DiT的知识迁移至线性复杂度的学生模型,实验结果显示效果与原模型相当;同时,该策略在生成8K分辨率图像时,减少了99.5%的注意力计算,并提高了6.3倍的生成速度。所使用的数据集为自生成样本。
【链接】:https://www.aminer.cn/pub/6768d2afae8580e7ff5b3627
CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models
【要点】:本文介绍了CosyVoice 2,一种基于大规模语言模型优化的流式语音合成方法,实现了低延迟、高自然度和几乎无损的合成质量,提升了交互体验。
【方法】:通过引入有限标量量化提高语音编码效率,优化文本到语音模型架构,以及开发支持流式和非流式合成的块感知因果流匹配模型。
【实验】:CosyVoice 2在大规模多语言数据集上训练,实现了与人类 parity的自然度,极小的响应延迟和虚拟无损的流式合成质量。具体数据集名称未在摘要中提及。
【链接】:https://www.aminer.cn/pub/675f9338ae8580e7ff189e96
Autoregressive Video Generation without Vector Quantization
【要点】:本文提出了一种无需量化向量的自回归视频生成方法,通过非量化自回归模型实现了高效的视频帧间预测,提高了数据效率、推理速度和视觉保真度,同时降低了模型参数需求。
【方法】:作者将视频生成问题重新构建为基于帧的自回归时间预测和基于集合的空间预测的非量化模型,保持了GPT风格模型的因果性质,同时利用帧内的双向模型提高效率。
【实验】:作者训练了一个名为NOVA的自回归视频模型,并在多个指标上超过了之前的自回归视频模型,实验使用了自定义的数据集,具体数据集名称未在摘要中提及,实验结果表明NOVA在文本到图像生成任务上也优于最先进的图像扩散模型,且具有更低的训练成本。
【链接】:https://www.aminer.cn/pub/6763de14ae8580e7ff348a08
更多推荐

所有评论(0)