OmniAudio:它能够直接从360°视频生成空间音频,为虚拟现实和沉浸式娱乐带来了全新的可能性。 空间音频 … Continue reading “ICML25 | 让耳朵「看见」方向!仅依靠360°全景视频,就能生成3D空间音频”
![]()
OmniAudio:它能够直接从360°视频生成空间音频,为虚拟现实和沉浸式娱乐带来了全新的可能性。 空间音频 … Continue reading “ICML25 | 让耳朵「看见」方向!仅依靠360°全景视频,就能生成3D空间音频”
![]()
PixelFlow是一系列直接在原始像素空间中运行的图像生成模型,与主流的潜在空间模型形成对比。 香港大学和A … Continue reading “港大&Adobe联合提出图像生成模型PixelFlow,可直接在原始像素空间中运行,无需VAE即可进行端到端训练”
![]()
大型语言模型在生成解答之前会产生冗长的思考过程,这种方式在推理任务上已经取得了很好的成果。该研究对这一过程的必 … Continue reading “推理模型其实无需「思考」?伯克利发现有时跳过思考过程会更快、更准确”
![]()
AI绘画总「翻车」,不是抓不住重点,就是细节崩坏?别愁!微软和港中文学者带来ImageGen-CoT技术,让A … Continue reading “生图加入CoT,性能提升80%!微软港中文打造天才画手”
![]()
生成式 AI 正在重塑智能决策的未来!本综述系统性地归纳了七种生成模型,构建了一个全新的决策智能分类框架,涵盖 … Continue reading “华为诺亚综述:生成式模型如何用于决策?”
![]()
随着大模型在电商领域的广泛应用,如何精准评估其对专业领域知识的掌握成为关键挑战。 全面评估大模型电商领域能力, … Continue reading “27个大模型混战电商领域,DeepSeek-R1&V3仍是最强丨首个中文电商问答基准评估结果”
![]()
近日,知名生成式 AI 创业公司 Stability AI 的前研究主管 Tanishq Abraham 终于 … Continue reading “自有歪果仁为DeepSeek「辩经」:揭穿围绕DeepSeek的谣言”
![]()
在本文中,我们提出了一种新颖的图像编辑方法DragonDiffusion,可在扩散模型上实现Drag式的操作。 … Continue reading “拖动图像编辑再升级!北大、腾讯提出DragonDiffusion,在扩散模型上启用拖动式操作”
![]()
清华大学联合字节提出了一项虚拟试穿新方法AnyDressing: 可以利用参考的服饰和文本prompt定制化人 … Continue reading “字节 & 清华大学提出 AnyDressing :通过潜在扩散模型实现可定制的多服装虚拟试穿。”
![]()
除了显而易见的清晰度的提升——最高可达4K分辨率,它能够忠实地遵循简单和复杂的指令Prompt,并令人信服地模 … Continue reading “谷歌版Sora升级4K高清!一句话控制镜头运动,跑分叫板可灵海螺”
![]()