谷歌相册新增虚拟衣橱与手动堆叠功能
谷歌相册推出虚拟衣橱和手动照片堆叠功能,前者利用AI搭配用户已有衣物,后者便于手动整理照片库。
浏览计算机视觉领域的最新新闻、进展与深度报道。
谷歌相册推出虚拟衣橱和手动照片堆叠功能,前者利用AI搭配用户已有衣物,后者便于手动整理照片库。
Hugging Face推出NeoMME多模态编码器,以单一Transformer同时处理文本和图像,无需独立视觉塔,文档检索速度较同类模型提升约一倍。
据雷峰网报道,中山大学团队提出SpatialSV方法,让多模态大模型在隐藏层学习三维几何表示。实验显示,以开源3D模型自动生成监督替代一半人工标注后,模型空间问答准确率仍接近全量标注。
李飞飞创办的World Labs发布全球首个多模态世界模型Atlas。它能基于几张照片生成最长1分钟的1440p视频,并实现空间重建,为机器人训练提供低成本仿真方案。
Nvidia DLSS 5于9月3日随NBA 2K27正式上线,首发仅支持RTX 50系显卡。该技术因改变角色外观引发争议,媒体试玩认为效果细腻但性能开销巨大。
戴森9月1日在巴黎发布CameraJet电动牙刷,集成10万像素摄像头与AI,可在刷牙时识别牙缝并喷射漱口水,售价约500美元。
高德8月28日发布ABot-Recon,无需长程记忆,仅凭12帧即可实时重建万帧3D场景,在多项权威基准中取得最低误差。
以色列研究人员利用AI分析乳腺X光片,可识别女性冠心病、高血压和中风,或使乳腺癌筛查兼具心脏健康检查功能。
由前Meta科学家创立的Perceptron发布开源视觉模型Isaac 0.5,旨在帮助机器人在仓库和工厂灵活感知、推理与行动,公司已完成2100万美元融资。
寻影联合创始人李亮接受专访,回顾公司从AI相机创业到成为高端Webcam全球第一的历程,认为影像自动化是终局,真正的竞争在场景。
清华大学与香港科技大学团队提出实时流式视频编辑框架LiveEdit,通过三阶段蒸馏和掩码缓存,在4步推理下实现12.66 FPS,被ECCV 2026接收并开源。
据Android Authority报道,随着Android系统升级,文档扫描、二维码扫描、剪贴板管理等功能已原生支持,用户无需再下载第三方应用。
伍兹霍尔海洋研究所研发新系统,将声呐与图像匹配算法结合,让水下遥控潜水器在浑浊沉积物中也能实时看清环境,无需等待水体变清。
AI并未如辛顿所预言取代放射科医生,但已大量应用于放射学领域。截至2026年初,FDA批准的约1400种AI医疗器械中四分之三用于放射学,正深刻改变医生工作方式。
据爱范儿报道,阅星瞳X3墨水屏经智能体改造成为信息看板,苹果未来AirPods将配备100万像素摄像头用于视觉识别,两者均显示AI硬件正从屏幕内走向物理世界,以低功耗和聚焦式交互承担信息筛选功能。
据MarkTechPost报道,deepDoctection 1.2.x提供端到端文档智能管道,集成布局检测、表格识别、OCR、阅读顺序重建与结构化导出,可服务RAG等下游系统。
据TechRadar报道,苹果带摄像头AirPods的更多规格泄露,可拍1MP照片,用于AI感知,预计明年亮相,但引发隐私担忧。
据TechRadar报道,便携式AI健身教练BodyPark Atom在测评中凭借AI动作映射技术获好评,能实时提供动作反馈并纠正深蹲、硬拉等训练动作,起售价219美元。
DeepSeek推出多模态语言模型V4 Flash Vision Exp,在ALE和ZeroBench等视觉基准上超越Anthropic的Opus 4.8,目前仅向付费开发者提供。
9to5Mac作者分享iPhone随身拍摄的优势,强调其便携性、稳定性和易用性,为视频项目提供高质量素材。
DeepSeek今日推出实验性多模态模型deepseek-v4-flash-vision-exp,新增视觉理解能力,支持Agent任务,已上线API并获Harness原生支持。
Chance AI创始人兼CEO在TechRadar发文指出,AI从训练转向推理之际,相机竞赛焦点将从画质转向“理解”。传感器正变成感知问题,设备商需将推理质量与画质同等重视。
中国研究人员宣称开发出轻量级AI系统,可识别F-22和F-35隐身战机的红外特征,实验室模拟识别准确率超90%,但实战性能未证实。
据MarkTechPost报道,8月17日发布教程,演示利用docTR构建端到端文档智能流水线,涵盖OCR、布局分析、KIE、基准测试及可搜索PDF导出。