{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,2]],"date-time":"2026-06-02T09:29:16Z","timestamp":1780392556305,"version":"3.54.1"},"reference-count":34,"publisher":"IEEE","license":[{"start":{"date-parts":[[2023,6,1]],"date-time":"2023-06-01T00:00:00Z","timestamp":1685577600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/2.zoppoz.workers.dev:443\/https\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2023,6,1]],"date-time":"2023-06-01T00:00:00Z","timestamp":1685577600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/2.zoppoz.workers.dev:443\/https\/doi.org\/10.15223\/policy-037"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2023,6]]},"DOI":"10.1109\/cvpr52729.2023.00121","type":"proceedings-article","created":{"date-parts":[[2023,8,22]],"date-time":"2023-08-22T17:30:52Z","timestamp":1692725452000},"page":"1190-1199","source":"Crossref","is-referenced-by-count":60,"title":["Open-Vocabulary Point-Cloud Object Detection without 3D Annotation"],"prefix":"10.1109","author":[{"given":"Yuheng","family":"Lu","sequence":"first","affiliation":[{"name":"School of Computer Science,National Key Laboratory for Multimedia Information Processing"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Chenfeng","family":"Xu","sequence":"additional","affiliation":[{"name":"University of California Berkeley"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Xiaobao","family":"Wei","sequence":"additional","affiliation":[{"name":"School of Computer Science,National Key Laboratory for Multimedia Information Processing"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Xiaodong","family":"Xie","sequence":"additional","affiliation":[{"name":"School of Computer Science,National Key Laboratory for Multimedia Information Processing"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Masayoshi","family":"Tomizuka","sequence":"additional","affiliation":[{"name":"University of California Berkeley"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Kurt","family":"Keutzer","sequence":"additional","affiliation":[{"name":"University of California Berkeley"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Shanghang","family":"Zhang","sequence":"additional","affiliation":[{"name":"School of Computer Science,National Key Laboratory for Multimedia Information Processing"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.322"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01553"},{"key":"ref34","article-title":"Detecting twenty-thousand classes using image-level supervision","author":"zhou","year":"2022","journal-title":"ArXiv Preprint"},{"key":"ref15","first-page":"9735","article-title":"Weakly supervised object detection with segmentation col-laboration","author":"li","year":"0","journal-title":"Proceedings of the IEEEICVF International Conference on Computer Vision"},{"key":"ref14","first-page":"16797","article-title":"Comprehensive attention self-distillation for weakly-supervised object detection","volume":"33","author":"huang","year":"2020","journal-title":"Advances in neural information processing systems"},{"key":"ref31","article-title":"A simple baseline for zero-shot semantic segmentation with pretrained vision-language model","author":"xu","year":"2021","journal-title":"ArXiv Preprint"},{"key":"ref30","first-page":"638","article-title":"Image2point: 3d point-cloud understanding with 2d image pretrained models","author":"chenfeng","year":"0","journal-title":"European Conference on Computer Vision"},{"key":"ref11","first-page":"5356","article-title":"L vis: A dataset for large vocabulary instance segmentation","author":"gupta","year":"0","journal-title":"Pro-ceedings of the IEEEICVF Conference on Computer Vision and Pattern Recognition"},{"key":"ref33","article-title":"Pointclip: Point cloud understanding by clip","author":"zhang","year":"2021","journal-title":"ArXiv Preprint"},{"key":"ref10","first-page":"arxiv-2104","article-title":"Zero-shot detection via vision and language knowledge distillation","author":"gu","year":"2021","journal-title":"ArXiv e-prints"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.01416"},{"key":"ref2","first-page":"213","article-title":"End-to-end object detection with transformers","author":"carion","year":"0","journal-title":"European Conference on Computer Vision"},{"key":"ref1","article-title":"3dos: Towards 3d open set learning-benchmarking and understanding semantic novelty detection on point clouds","author":"alliegro","year":"0","journal-title":"Thirty-sixth Conference on Neural Information Processing Systems Datasets and Benchmarks Track"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00290"},{"key":"ref16","article-title":"Simple open-vocabulary object detection with vision transformers","author":"minderer","year":"2022","journal-title":"ArXiv Preprint"},{"key":"ref19","first-page":"8748","article-title":"Learning transferable visual models from natural language super-vision","author":"radford","year":"0","journal-title":"International Conference on Machine Learning"},{"key":"ref18","article-title":"Repre-sentation learning with contrastive predictive coding","author":"van den oord","year":"2018","journal-title":"ArXiv Preprint"},{"key":"ref24","first-page":"118","article-title":"Enabling deep residual networks for weakly supervised object detection","author":"shen","year":"0","journal-title":"European Conference on Computer Vision"},{"key":"ref23","article-title":"Language-grounded indoor 3d semantic segmentation in the wild","author":"rozenberszki","year":"2022","journal-title":"ArXiv Preprint"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2022.acl-long.421"},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00079"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v34i07.6868"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01042"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-020-01355-6"},{"key":"ref28","first-page":"384","article-title":"Identifying unknown instances for autonomous driving","author":"wong","year":"0","journal-title":"Conference on Robot Learning"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2015.7298655"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2015.7298801"},{"key":"ref8","article-title":"An image is worth 16&#x00D7;16 words: Trans-formers for image recognition at scale","author":"dosovitskiy","year":"2020","journal-title":"ArXiv Preprint"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.261"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2015.169"},{"key":"ref4","article-title":"Open-world semantic segmentation for lidar point clouds","author":"cen","year":"0","journal-title":"ECCV"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1109\/3DV53792.2021.00095"},{"key":"ref6","first-page":"8765","article-title":"Debiased contrastive learning","volume":"33","author":"chuang","year":"0","journal-title":"Advances in Neural Information Processing Sys-tems"},{"key":"ref5","first-page":"1597","article-title":"A simple framework for contrastive learning of visual representations","author":"chen","year":"0","journal-title":"International Conference on Machine Learning"}],"event":{"name":"2023 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR)","location":"Vancouver, BC, Canada","start":{"date-parts":[[2023,6,17]]},"end":{"date-parts":[[2023,6,24]]}},"container-title":["2023 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR)"],"original-title":[],"link":[{"URL":"https:\/\/2.zoppoz.workers.dev:443\/http\/xplorestaging.ieee.org\/ielx7\/10203037\/10203050\/10203153.pdf?arnumber=10203153","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2023,9,11]],"date-time":"2023-09-11T17:59:24Z","timestamp":1694455164000},"score":1,"resource":{"primary":{"URL":"https:\/\/2.zoppoz.workers.dev:443\/https\/ieeexplore.ieee.org\/document\/10203153\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2023,6]]},"references-count":34,"URL":"https:\/\/2.zoppoz.workers.dev:443\/https\/doi.org\/10.1109\/cvpr52729.2023.00121","relation":{},"subject":[],"published":{"date-parts":[[2023,6]]}}}