a tall building lit up at night

微软亚洲研究院

科学匠人 | 郭宗昱:在AI时代主动“转身”,让多媒体成为会思考的“智能体”

已发布

编者按:什么样的研究员能在AI浪潮中持续保持创造力?微软亚洲研究院高级研究员郭宗昱,习惯把一件事从构想到落地一路推进,尤其专注于完成从0到80分的关键跨越。清醒的自我认知,让他在流媒体浪潮下扎根视频编解码研究,又在生成式AI爆发后果断转向Agentic Media(智能体式媒体)这一前沿方向。在唯快不破的AI时代,这种拥抱变化、主动转身的勇气,以及对信息本质的追寻,或许正是每一位身处浪潮中的探索者持续前行的关键所在。


工科与理科、文科以及商科最大的不同,在于它更强调“构建”的过程,即在既定目标下,快速将想法落地实现。微软亚洲研究院高级研究员郭宗昱很早就意识到,自己的性格与这种思维方式天然契合。

“就像盖一座房子,从打地基、主体搭建到装修前的阶段,我很享受这个从0到80分的过程。”他说,“我喜欢这种一步步设计、开发整个系统,并亲手完成每一个环节的感觉。”

这种对“构建”的热爱,让他坚定地选择了计算机专业,也让他在后来持续深耕多媒体视频编解码领域。

photo
微软亚洲研究院高级研究员郭宗昱

走进微软亚洲研究院,做最具实用化前景的工作

2019年攻读博士期间,郭宗昱亲历了重塑全球沟通方式的技术浪潮。远程会议、在线娱乐、云端协作迅速普及,音视频应用迎来爆发式增长,视频流量呈指数级攀升。而海量视频传输与存储背后,是千亿级的带宽与成本压力。

“如果视频压缩效率能提升1%,那么背后可能就是整个行业巨大的成本优化空间。”因此,郭宗昱将研究方向聚焦在了基于深度学习的图像与视频编解码领域,希望从底层实现技术突破,为高效的信息传输提供全新解法。

谈及视频编解码研究,郭宗昱总会提到本科阶段让他颇感挑战的课程——信息论。这门由香农于20世纪40年代奠基的学科,用数学语言定义了信息的本质。其中,“香农熵”、“柯尔莫哥洛夫复杂性(Kolmogorov Complexity)”等核心概念,揭示了一个关键问题:如何用最短的描述传递最多的信息。

在他看来,这恰恰是视频编解码,以及AI时代追求智能的核心。“视频压缩本质上就是不断寻找视频信号的最小描述长度。”这种从信息本质出发的理解,也让他开始从更底层、更系统的角度重新思考视频编解码技术的价值与方向。

2021年底,郭宗昱来到微软亚洲研究院实习,参与了“基于神经网络参数的视频表征”研究。在这里,他第一次真正感受到AI技术与视频编解码深度融合所带来的突破性潜力。

传统视频编解码技术高度依赖运动估计模块的复杂设计,而微软亚洲研究院媒体计算组提出的实时神经视频编解码技术则尝试跳出传统框架,通过隐式时序建模、单分辨率潜像学习等创新方法,在降低运算开销的同时,实现更高压缩率与更低延迟。相关成果在商用级硬件上实现了1080p视频实时编解码,相较传统顶级编码标准,平均节省超过20%的码率,显著提升了技术实际落地的可能性。

photo
在微软亚洲研究院实习期间,郭宗昱(左)与原微软亚洲研究院联培博士魏国强(右)合影

实习期间,郭宗昱逐渐意识到,微软亚洲研究院吸引他的不仅是一流的科研团队与研究环境,更重要的是,这里的研究面向真实问题,并具备明确的“实用化前景”。这种前沿探索与产业落地的研究氛围,正是他理想中的科研模式。博士毕业后,他选择正式加入微软亚洲研究院,成为媒体计算组的一员。

让多媒体成为智能体:重新定义人与信息的交互边界

加入微软亚洲研究院时,媒体计算组正与微软Teams团队展开合作,加速实时视频编解码技术的产品化落地。基于研究组在实时编解码领域的长期积累,郭宗昱继续围绕视频会议中的带宽消耗问题展开优化研究。在原有基础上,他通过算法优化,进一步将视频码率降低了8%-10%。“我整个博士阶段在研究的技术,终于开始真正走向产品化了。”郭宗昱感慨道。

但随着AI技术的快速发展,他和团队同事也逐渐意识到,视频编解码的未来,或许并不只是“把视频压得更小”。在大模型与生成式AI驱动下,信息表征的范式与交互方式正在发生根本性变化。传统的像素、帧序列表征,已难以适配AI对信息的理解、交互与生成需求。

于是,郭宗昱开始将研究方向转向一个更前沿的课题——Agentic Media(智能体式媒体),探索AI时代信息表征的全新范式,推动媒体从单纯的“传输介质”转变为“智能体”。

“AI时代的媒体,核心是构建AI原生、面向人类体验的新型媒体形态。”在微软亚洲研究院媒体计算组看来,新一代媒体需要具备两大关键特质:一是可高效共享,即延续压缩技术的优势,实现更低带宽、更高质量的信息传输;二是具备人机交互能力,让信息不再是被动呈现的静态内容,而是能响应人类意图、适配个性化需求的动态智能体。

例如,未来的视频或图像在解码后,不再仅仅是原始的视听文件,更能被智能解码为符合不同用户需求的形态;又或者,日常产生的邮件、文档、图像、视频,都将会作为Agentic Media被整合,以提供更加清晰的人类记忆与恰到好处的帮助。

为了实现这一目标,研究团队提出了Agentic Media的三层架构:最上层是交互层,聚焦生成式UI,让界面能够根据用户偏好与意图动态适配;中间是处理层,依托现有大模型能力,实现多模态信息的理解、整合与智能处理;底层则是记忆层,构建AI可理解、可存储、可调用的多模态信息表征,为交互与处理提供底层支撑。

cartoon
Agentic Media:多媒体作为合作伙伴与人类交互对话

围绕这一体系,郭宗昱和同事们积极推进AI原生媒体的相关研究。在基础研究层面,团队延续神经表征方向的核心思路,尝试将图像、视频等多模态信息转化为神经网络参数,让信息能够以更适合AI调用的形式存储和使用。在应用层面,团队则聚焦于多模态信息难以被AI处理的痛点,将复杂的视觉内容转化为结构化的文本描述,提取核心场景、主体、动作等关键信息。这不仅能够提升传输效率,更打通了视觉信息与AI交互的壁垒,使其能够被大模型直接理解和使用。

“AI研究正从纯软件算法的量化指标竞赛,转向人类体验(human experience)与物理世界探索两大方向。”郭宗昱指出,“过去,行业聚焦于模型参数、算法精度的优化;如今,如何让AI真正服务于人、适配人的个性化需求,如何让数字智能与物理世界深度融合,同时将人类经验纳入AI系统闭环(human-in-the-loop),已成为当前的核心命题。而Agentic Media的核心价值,正是服务于人的体验。

未来,无论是个体交互、团队协作,还是企业组织管理,郭宗昱希望AI原生媒体能够更精准地传递意图、更高效地组织信息,并最终重构人与信息、人与人之间的协作方式。

在快速变化的时代主动“转身”

在过往的求学与研究生涯中,郭宗昱经历了两次关于AI认知的“顿悟时刻”,这彻底重塑了他对AI的认知,也让他学会在快速变迁的时代中,主动调整、勇敢转身。

第一次顿悟发生在2023年。当时,他有幸参加了Geoffrey Hinton的闭门交流会。Hinton指出,蒸馏技术与MoE(混合专家架构)将成为AI发展的关键方向。这让郭宗昱深刻意识到,AI的发展始终遵循着“第一性原理”与自然规律。例如,蒸馏技术本质上是老师向学生传递核心知识的过程,契合了人类的学习规律;而MoE则模拟了人脑多模块分工的机制,以此实现不同任务的高效处理。相比于人类,AI 在学习上更具有优势:只要带宽无限,复制网络参数就可以实现一次智能的传播。

第二次顿悟则源于聆听微软内部的高级别报告会。当讨论“AI能否取代人类创造力”时,“创造力并非人类独有”这一观点让郭宗昱深受触动。他意识到AI不止是提升生产力的工具,更具备了理解并创造美感与价值的潜能。其关键在于人类是否愿意打破旧有的观念体系,去主动拥抱这场深刻的变革。

但他坚信,在真正重要的技术变革出现时,越早完成转变,越容易看见新的可能。“很多时候,做出转变的抉择才是最困难的一步。一旦真正开始改变,你就会发现,改变其实并没有想象中那么难。”

相关工作:

Agentic Media项目页面:http://approjects.co.za/?big=en-us/research/publication/agentic-media/

Towards Practical Real-Time Neural Video Compression(CVPR 2025)

https://arxiv.org/abs/2502.20762 (opens in new tab)

Compression as Adaptation: Implicit Visual Representation with Diffusion Foundation Models(ICML 2026)
https://arxiv.org/abs/2603.07615 (opens in new tab)