该研究探讨街景图像在视觉语言模型城市感知中相对于既有城市数据的增量价值,而非仅关注预测精度。作者针对七类城市属性,利用五个公共数据源和三种视觉语言模型,对同一城市单元分别用图像、任务上下文、邻近观测和公共记录进行评估,并通过图像替换与冲突记录测试模型的数据依赖。结果显示,既有城市数据在道路损坏、路缘坡道和房价上达到或超过纯图像模型,邻近官方统计在人口预测上接近最佳图像结果;图像在建筑类型、功能和低层楼层数上更具信息量。楼层数预测中,图像优势随距最近标注建筑距离每翻倍增加5.7个百分点,但对屋顶线常超出画面的高层建筑则减弱。模型常跟随冲突记录,且OpenFACADES楼层标注因使用OpenStreetMap数据而呈现与纯图像相反的误差模式。研究表明,街景图像的价值取决于视觉可辨识度和本地数据覆盖,图像与既有数据对比可指导采集并厘清衍生城市地图的来源。
| Street-view imagery | 街景图像,指通过车辆或行人拍摄的城市街道全景照片,常用于城市感知任务。 |
| VLM (Vision-Language Model) | 视觉语言模型,一种能同时处理图像和文本的多模态人工智能模型,用于图像理解和推理。 |
| Urban sensing | 城市感知,利用各种数据源(如传感器、图像)来监测和推断城市环境特征的过程。 |
| OpenFACADES | 一个开放的建筑立面数据集,包含建筑属性标注,如楼层数,用于城市分析。 |
| OpenStreetMap | 开放街图,一个 collaborative 编辑的免费世界地图,提供地理数据和建筑信息。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅