[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"detail-sidebar-cat-1-en-105":3,"doc-seo-190905-105":53,"doc-detail-190905-en":126},{"code":4,"msg":5,"data":6},0,"success",[7,14,19,24,29,34,39,44,49],{"id":8,"doc_module":9,"doc_module_name":10,"category_name":11,"show_sort_weight":12,"slug":13},11,1,"Template","Presentations",90,"presentations",{"id":15,"doc_module":9,"doc_module_name":10,"category_name":16,"show_sort_weight":17,"slug":18},12,"Resumes",80,"resumes",{"id":20,"doc_module":9,"doc_module_name":10,"category_name":21,"show_sort_weight":22,"slug":23},14,"Invoices",70,"invoices",{"id":25,"doc_module":9,"doc_module_name":10,"category_name":26,"show_sort_weight":27,"slug":28},15,"Posters",60,"posters",{"id":30,"doc_module":9,"doc_module_name":10,"category_name":31,"show_sort_weight":32,"slug":33},16,"Social Media",50,"social-media",{"id":35,"doc_module":9,"doc_module_name":10,"category_name":36,"show_sort_weight":37,"slug":38},17,"Forms",40,"forms",{"id":40,"doc_module":9,"doc_module_name":10,"category_name":41,"show_sort_weight":42,"slug":43},18,"Letters",30,"letters",{"id":45,"doc_module":9,"doc_module_name":10,"category_name":46,"show_sort_weight":47,"slug":48},21,"Paper Templates",5,"papers-templates",{"id":50,"doc_module":9,"doc_module_name":10,"category_name":51,"show_sort_weight":4,"slug":52},158,"General","general-158",{"code":4,"msg":54,"data":55},"ok",{"site_id":56,"language":57,"slug":58,"title":59,"keywords":60,"description":61,"schema_data":62,"social_meta":119,"head_meta":121,"extra_data":123,"updated_unix":125},105,"en","icassp-2023-program-oral-sessions","ICASSP 2023 Program - Oral Sessions","","ICASSP 2023 oral session program listing schedules, rooms, chairs, and paper sessions across audio, multimedia, multimodal processing, drone-versus-bird detection, and human identification and face recognition. The program specifies time slots from 10:50 AM to 12:20 PM and enumerates multiple presented works with session codes, including topics such as text-to-audio sound generation, large-scale action sound datasets, word localization from audio, lip-feature fusion for audio-visual estimation, and unified audio-visual modeling. It also details drone detection methods using YOLO variants and attention or feature pyramid networks, plus introductory session entries and speaker affiliations.",{"@graph":63,"@context":118},[64,80,101],{"@type":65,"itemListElement":66},"BreadcrumbList",[67,71,74,77],{"item":68,"name":69,"@type":70,"position":9},"https://docshare.wps.com","Home","ListItem",{"item":72,"name":10,"@type":70,"position":73},"https://docshare.wps.com/template/",2,{"item":75,"name":11,"@type":70,"position":76},"https://docshare.wps.com/template/presentations/",3,{"item":78,"name":59,"@type":70,"position":79},"https://docshare.wps.com/template/icassp-2023-program-oral-sessions/190905/",4,{"url":78,"name":59,"@type":81,"image":82,"author":87,"headline":59,"publisher":90,"fileFormat":93,"inLanguage":57,"description":61,"dateModified":94,"datePublished":95,"encodingFormat":93,"isAccessibleForFree":96,"interactionStatistic":97},"DigitalDocument",{"url":83,"@type":84,"width":85,"height":86},"https://docshare.wps.com/thumbnails/icassp-2023-program-oral-sessions/190905.png","ImageObject",442,249,{"name":88,"@type":89},"Levi","Person",{"url":68,"name":91,"@type":92},"DocShare","Organization","application/pdf","2026-10-03","2026-09-03",true,{"@type":98,"interactionType":99,"userInteractionCount":47},"InteractionCounter",{"@type":100},"ViewAction",{"@type":102,"mainEntity":103},"FAQPage",[104,110,114],{"name":105,"@type":106,"acceptedAnswer":107},"Which time window does the oral session program cover for these tracks?","Question",{"text":108,"@type":109},"The listed oral sessions run from 10:50 AM to 12:20 PM.","Answer",{"name":111,"@type":106,"acceptedAnswer":112},"What topics are covered in the AASP-L1 track?",{"text":113,"@type":109},"AASP-L1 focuses on audio for multimedia and multimodal processing, including text-to-sound generation, large-scale sound/action datasets, audio-informed word localization, and audio-visual localization/DOA estimation methods.",{"name":115,"@type":106,"acceptedAnswer":116},"What methods are highlighted in the GC-1 drone-vs-bird detection challenge?",{"text":117,"@type":109},"GC-1 highlights drone detection approaches such as YOLO-V8 and YOLOv7 combined with tracking (CSRT), along with feature pyramid and attention models for drone detection.","https://schema.org",{"og:url":78,"og:type":120,"og:title":59,"og:site_name":91,"og:description":61},"article",{"robots":122,"canonical":78},"index,follow",{"doc_id":124,"site_id":56},190905,1788405489,{"code":4,"msg":5,"data":127},{"doc_id":124,"user_id":128,"nickname":88,"user_avatar":129,"doc_module":9,"category_id":8,"category_name":11,"doc_title":59,"doc_description":61,"doc_content":130,"file_id":131,"file_url":132,"file_type":133,"file_size":134,"view_count":47,"is_deleted":4,"is_public":9,"is_downloadable":9,"audit_status":9,"page_count":135,"language":136,"language_code":57,"site_id":56,"html_lang":57,"table_of_contents":137,"faqs":138,"seo_title":139,"seo_description":61,"update_tm":125,"read_time":140},7971461740909,"https://ap-avatar.wpscdn.com/davatar_155a257f0dc6eb9ab79c44ca47cae57d","| AASP-L1 : Audio for Multimedia and Multimodal Processing Room: Salon des Roses A\u003Cbr>Type: Oral\u003Cbr>10:50 AM to 12:20 PM\u003Cbr>Chair(s): Mark Plumbley, Lin Wang |\n| --- |\n| 10:50 AM\u003Cbr>647 (AASP-L1.1): Diverse and Vivid Sound Generation from Text Descriptions\u003Cbr>Guangwei Li (Shanghai Jiao Tong University); Xuenan Xu (Shanghai Jiao Tong University); Lingfeng Dai (Shanghai Jiao Tong University); Mengyue Wu (Shanghai Jiao Tong University); Kai Yu (Shanghai Jiao Tong University)\u003Cbr>11:05 AM\u003Cbr>2248 (AASP-L1.2): EPIC-SOUNDS : A LARGE-SCALE DATASET OFACTIONS THAT SOUND\u003Cbr>Jaesung Huh (University of Oxford); Jacob Chalk (University of Bristol); Evangelos Kazakos (Dept. of Computer Science and Engineering-University of Ioannina); Dima Damen (University of Bristol); Andrew Zisserman (University of Oxford)\u003Cbr>11:20 AM\u003Cbr>784 (AASP-L1.3): I SEE WHAT YOU HEAR: A VISION-INSPIRED METHOD TO LOCALIZE WORDS\u003Cbr>Mohammad Samragh (Apple); Arnav Kundu (Apple); Ting-Yao Hu (Carnegie Mellon University); Aman Chadha (Stanford University/Amazon Inc.); Ashish Shrivastava (Apple); Minsik Cho (Apple ); Oncel Tuzel (Apple); Devang Naik (Apple)\u003Cbr>11:35 AM\u003Cbr>6119 (AASP-L1.4): Incorporating lip features into audio-visual multi-speaker DOA estimation by gated fusion\u003Cbr>Ya Jiang (University of Science and Technology of China); Hang Chen (USTC); Jun Du (University of Science and Technology of China); Qing Wang (University of Science and Technology of China); Chin-Hui Lee (Georgia Institute of Technology)\u003Cbr>11:50 AM\u003Cbr>6787 (AASP-L1.5): UAVM: Towards Unifying Audio and Visual Models (SPS Journal Paper)*\u003Cbr>Yuan Gong (Massachusetts Institute of Technology); Alexander H Liu (MIT); Andrew Rouditchenko (MIT CSAIL); James Glass (Massachusetts Institute of Technology) |\n| GC-1: Drone-vs-Bird Detection Grand Challenge at ICASSP23\u003Cbr>Room: Nefeli B\u003Cbr>Type: Oral\u003Cbr>10:50 AM to 12:20 PM\u003Cbr>Chair(s): Angelo Coluccia, Alessio Fascista, Arne Schumann, Lars Sommer, Anastasios Dimou, Dimitrios Zarpalas, Nabin Sharma |\n| 10:50 AM\u003Cbr>6617 (GC-L1.1): Introduction\u003Cbr>Angelo Coluccia (University of Salento); Alessio Fascista (University of Salento); Arne Schumann (Fraunhofer IOSB); Lars Sommer (Fraunhofer IOSB, Karlsruhe, Germany); Anastasios Dimou (Information Technologies Institute / Centre for Research and Technology Hellas); Dimitrios Zarpalas (CERTH / CENTRE FOR RESEARCH AND TECHNOLOGY HELLAS); Nabin Sharma (University of Technology, Sydney)\u003Cbr>11:10 AM\u003Cbr>6834 (GC-L1.2): HIGH-SPEED DRONE DETECTION BASED ON YOLO-V8\u003Cbr>JUN-HWA KIM (Dongguk University); Namho KIM (Dongguk University); Chee Sun Won (Dongguk University)\u003Cbr>11:22 AM\u003Cbr>6863 (GC-L1.3): S-FEATURE PYRAMID NETWORK AND ATTENTION MODEL FOR DRONE DETECTION\u003Cbr>Pengcheng Dong (Shandong Normal University); Chuntao Wang (Shandong Normal University); Zhenyong Lu (Shandong Normal University); Kai Zhang (Shandong Normal University); Wenbo Wan (Shandong Normal University); Jiande Sun (Shandong Normal University)\u003Cbr>11:34 AM\u003Cbr>6881 (GC-L1.04): DRONE-VS-BIRD: DRONE DETECTION USING YOLOV7 WITH CSRT TRACKER\u003Cbr>Sahaj K Mistry (Indian Institute of Technology Jammu); Shreyas Chatterjee (Indian Institute of Technology Jammu); Ajeet Kumar Verma (Indian Institute of Technology Jammu); Vinit Jakhetiya (IIT JAMMU); Badri Subudhi (Indian Institute of Technology, Jammu); Sunil Jaiswal (K|Lens GmbH) |\n| IVMSP-L1: Human Identification and Face Recognition\u003Cbr>Room: Athena\u003Cbr>Type: Oral\u003Cbr>10:50 AM to 12:20 PM\u003Cbr>Chair(s): Mang Ye, Lizhuang Ma |","cbCaimPAEPOP4gaK","https://ap.wps.com/l/cbCaimPAEPOP4gaK","pdf",2150881,219,"English","# AASP-L1: Audio for Multimedia and Multimodal Processing Room: Salon des Roses A\n## AASP-L1.1 to AASP-L1.5\n# GC-1: Drone-vs-Bird Detection Grand Challenge at ICASSP23 Room: Nefeli B\n## GC-L1.1 to GC-L1.04\n# IVMSP-L1: Human Identification and Face Recognition Room: Athena","[{\"question\":\"Which time window does the oral session program cover for these tracks?\",\"answer\":\"The listed oral sessions run from 10:50 AM to 12:20 PM.\"},{\"question\":\"What topics are covered in the AASP-L1 track?\",\"answer\":\"AASP-L1 focuses on audio for multimedia and multimodal processing, including text-to-sound generation, large-scale sound/action datasets, audio-informed word localization, and audio-visual localization/DOA estimation methods.\"},{\"question\":\"What methods are highlighted in the GC-1 drone-vs-bird detection challenge?\",\"answer\":\"GC-1 highlights drone detection approaches such as YOLO-V8 and YOLOv7 combined with tracking (CSRT), along with feature pyramid and attention models for drone detection.\"}]","ICASSP 2023 Program - Oral Sessions | PDF",77]