![]()
原文发表于 《科技导报》2026年第13期科技新闻-前沿动态
机器眼睛戴上会计算的“镜片”
摄像头看见一辆车,通常要先把画面变成电信号,再交给芯片完成卷积、注意力和多层特征提取。画面越清楚、任务越多,数据搬运和乘加运算越重。自动驾驶、无人机和手机又不能总把视频送到云端,延迟、能耗和隐私都要求机器在现场做判断。
香港中文大学彭佳勇、罗明成、黄超然团队与合作者把一部分视觉计算移到了镜头前。其光电视觉引擎的前端是一块含4100万个光学参数的超表面,后端数字网络只有8.7万个参数。系统在目标检测、语义分割、三维重建和视频理解等任务上超过多种拥有数千万参数的纯数字模型,并在自然光场景中实时运行。2026年6月25日,相关研究成果发表于《Nature》。
超表面由尺寸小于光波长的纳米结构组成。光穿过这些“微型路标”时,相位和振幅会按设计改变,输入图像因此在到达传感器前已经完成一次并行变换。它不像普通镜头只负责聚焦,更像把一张巨大的固定计算表刻在玻璃上:每束光同时走完自己的路径,几乎不需要逐项搬运数据。
过去的光学神经网络往往卡在两处。照搬数字网络的精确矩阵运算,对制造误差、偏振和对准十分敏感;能在实验室处理手写数字或单一分类任务的装置,换到街景和视频就难以扩展。新系统没有光学器件逐层模仿电子网络,而是把相似性识别、注意力引导以及细节与上下文融合这三类视觉原则编码进光场。
研究团队让同一块超表面产生多路互补特征。数字后端只需从这些光学特征中挑选与任务相关的信息,相当于让光先做一遍高通量“粗加工”,电子芯片再负责可训练的精修。4100万这个数字主要对应超表面上的光学自由度,并不意味着它像4100万个可随时改写的晶体管;器件制成后,前端权重基本固定,任务适配发生在小型数字网络。
![]()
面向实际应用的视觉系统:一个适用于自动驾驶等应用的紧凑型计算系统
(图片来源:《Nature》)
论文在Cityscapes、DAVIS等高分辨率真实数据上测试静态和视频任务,还把原型带到室外。系统可以同时标出目标、分割道路与物体并估计深度,视频中还要保持前后帧的一致性。数据与训练模型已在Zenodo和GitHub公开,仓库给出的运行环境仍需要NVIDIA RTX 4090级显卡来复现实验流程,这也提醒人们:光学前端节省的是一段计算,不是整套系统的全部耗电。
该研究在英伟达Jetson Na‐no上测试了紧凑数字模型,目的正是观察小型边缘硬件能否接住光学前端的输出。对同一幅画面,超表面不会先还原一张供人观看的“漂亮照片”,而是直接产生机器更容易利用的编码。若场景任务改变,只需重训后端的少量参数;若连光谱和成像几何都改变,固定的光学映射就未必适用。
( 来源:《Nature》 )
《科技导报》创刊于1980年,中国科协学术会刊,主要刊登科学前沿和技术热点领域突破性的研究成果、权威性的科学评论、引领性的高端综述,发表促进经济社会发展、完善科技管理、优化科研环境、培育科学文化、促进科技创新和科技成果转化的决策咨询建议。常设栏目有院士卷首语、科技新闻、科技评论、本刊专稿、特色专题、研究论文、政策建议、科技人文等。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.