22 2026-07-22
场景驱动、垂直深耕,广州打造垂类模型之都再添硬核底座

当前广州正全力打造特色鲜明的“垂类模型之都”,2026世界人工智能大会期间,由广州大学、广州市社科联共建的粤语语料库建设与大模型评测重点实验室于7月19日应邀亮相大会“人工智能高质量语料生态论坛”,现场重磅发布两项原创核心成果——AI-DimSum粤语语料库平台(中文名:点心粤语语料库)搜索2.0粤语真实语音上下文交互能力评测基准CRS-Bench,以方言垂类数据底座打造广州AI差异化竞争力。


图片.png


方言承载湾区文化认同


粤语数据库筑牢AI可信文化根基


本届论坛共有25位院士出席,主旨演讲嘉宾汇聚图灵奖得主、6位中国工程院院士,共同围绕“高质量垂域语料如何破解AI落地瓶颈”展开深度研讨,为行业热议的“语料路径之争”给出权威答案。


中国工程院院士、粤语语料库建设与大模型评测重点实验室首席科学家方滨兴表示,粤语是粤港澳大湾区文化的标志性文化载体,是海内外华人中华文化认同的重要语言纽带,更是岭南文化的核心呈现,因此粤语有着超越方言范畴的独特价值。AI-DimSum多模态通用粤语语料库平台最重要的作用就是为粤语AI提供“文化忠实、安全可信、AI友好、持续成长”的数据基础设施底座。


图片.png


方滨兴在以《数据决定粤语AI的上限》为题的主旨演讲上提到,大模型“表面会说,不等于真正懂得”。“表面会说”与“真正懂得”之间,是一条由浅入深的能力链:既要理解词汇和句子的基本含义,也要感知语气、语调与情感态度;既要识别使用场景与逻辑条件,也要理解语言背后的文化背景、价值观与社会规范。“制约粤语大模型发展的首要因素,已不再是模型、算法和算力,而在于缺少高质量、成规模、持续增强的粤语大模型训练语料数据集,亟须建设面向粤语AI的数据基础设施。而这一点光靠政府政策是不够的,最重要的还是要和实际应用结合,以实际应用来系统性地推动以粤语为代表的方言类语料库建设与共享。”


锚定垂类发展赛道


广州携粤语AI核心成果亮相大会


事实上,广州本次发布的AI-DimSum粤语语料平台搜索2.0、粤语真实语音上下文交互能力评测基准CRS-Bench两大特色成果,既是本地粤语大模型研发实力的集中亮相,也是城市垂类大模型产业布局的全景展示。


广州市政府副秘书长、一级巡视员高裕跃指出,“广州立足产业基础与市场需求,大力推动人工智能应用示范,以‘场景驱动、垂直深耕’为路径建设‘垂类模型之都’。”


高裕跃认为,广州拥有雄厚的实体产业、丰富的应用场景及扎实的要素支撑。

首先产业底座雄厚,依托汽车、电子、商贸、医疗等千亿级集群,覆盖41个工业大类中的35个,提供海量数据与落地“试验田”,错位避开基础研究、软硬件闭环赛道。

其次场景应用丰富,大模型备案96款,居全国第三,覆盖18个细分领域,形成“一行业一标杆”格局;今年计划开放450个场景,覆盖民生、产业、治理等刚需。

再者要素支撑扎实,算力稳居全国第一梯队,今年将新增超4万P智算算力,全国首个城市综合算力平台已接入超1.6万P算力;叠加公共数据授权运营与琶洲算法大赛IP,构成“算力+数据+算法”黄金三角。




两大原创成果全新发布


国内率先建成粤语AI数据评测闭环体系


在论坛的生态共建启动仪式上,GOMAX AI总裁陈旻麒,国家信息中心信息化和产业发展部主任单志广,中国工程院院士邬江兴,上海市经济和信息化委员会副主任潘焱,广州市社科联党组书记、主席崔颂东等12位嘉宾共同按下启动按钮。

图片.png

论坛现场举行成果发布环节,两大粤语AI全新技术产品亮相,完整披露技术优势与迭代规划。


重点实验室主任、广州大学网络空间安全学院齐佳音教授代表重点实验室介绍了AI-DimSum粤语语料平台搜索2.0和粤语真实语音上下文交互能力评测基准CRS-Bench两项最新研究成果。

前者作为重点实验室在语料规模迈入TB级后推出的重要升级,具备三大特色:所有语料自带“身份证”,来源更可信;搜索结果分三层呈现——精确、关联和推荐,内容更丰富;融合社交功能和生态应用,实现搜索即社交、搜索即传播、搜索即应用。

后者由重点实验室与GOMAX LAB合作建设,基于真实粤语语音资源,体现地域变体、包含上下文情景、具有文化语义复杂度,开辟了AI粤语能力评测的新赛道。


齐佳音介绍,“从定位上,AI-DimSum多模态通用粤语语料库的目标是‘兼容岭南文化、兼容人工智能’的全球最大的多模态通用粤语语料库。从功能上,AI-DimSum粤语语料库不仅是传统的语言学语料库,更是服务于粤语AI创新的基础数据设施,构建从粤语语料库到粤语AI应用的完整开放创新生态。”齐佳音谈道,“未来我们希望能尽快对接产业应用,通过产业需求来拉动定制化语料的供给能力,包括各主要的大语言模型企业以及大湾区的各类民生政务中的粤语服务密集型领域。”


图片.png


齐佳音表示,此次发布的两项成果是广州将丰富鲜活的粤语资源转化为可用数据资产的重要实践。搜索平台2.0让海量粤语语料“找得准、信得过”,为教育、文创、媒体和人工智能企业提供了便捷可信的数据服务入口;评测基准则让模型能力“测得清、评得准”,有效避免“普通话迁移假象”和“伪粤语自我放大”两类偏差,将评测结果反馈到数据建设端,驱动模型能力持续提升。这标志着广州在全国率先构建起从语料建设到模型评测的粤语AI数据基础设施闭环,为推动粤港澳大湾区语言资源共建共享和文化交流互鉴提供了有力支撑。


现场观众、软极网络CEO郑志彬认为,本次两大粤语AI创新成果的发布意义深远,补齐了粤语数字化发展的数据基础设施短板,进一步筑牢岭南文化数字根基,助力增强本土文化自信。


社科科技双向融合


实验室搭建权威粤语标准助力岭南文化数字化出海


据了解,此次粤语AI成果亮相世界人工智能大会,是广州市社科联以社科重点实验室推动人文与科技双向奔赴的又一鲜活例证。



2024年11月,在广州市委宣传部指导推动下,广州市社科联与广州大学联合成立粤语语料库建设与大模型评测重点实验室,由中国工程院院士、广州大学网络空间安全学院名誉院长方滨兴,国家语言服务与粤港澳大湾区语言研究中心主任、广州大学二级教授屈哨兵担任双首席科学家,采取“1+1+N”协同模式,联动大湾区多方资源推动粤语语料建设从专业工程走向社会参与、从资源整理走向生态培育。


一年来,重点实验室围绕“兼容岭南文化”和“兼容人工智能”两项目标,建设AI-DimSum多模态通用粤语语料库平台,现已汇聚超100万字文本、3000小时高保真语音和1TB+音视频,建成岭南文化粤语思维链问答数据、粤语内容安全关键词语料、粤语大模型安全评测数据集等特色语料,孵化出粤语内容安全检测“保险箍”、粤语智能配音、粤语学习工具等10余款应用,先后入选国家语言文字信息化十大新闻和国家关键领域语言科技赋能创新项目案例,并在第五届琶洲算法大赛中承办了“点心杯——粤语及其内部方言分片的语音识别模型构建”赛事,向全球AI开发者提供独家高质量算法训练数据。


谈及建立粤语语料库建设与大模型评测重点实验室的初衷,广州市社科联党组成员、专职副主席郭德焱表示,“我们希望AI能真正读懂粤语的韵味,理解岭南文化的灵魂。通过建设高质量的粤语语料库,让AI成为大湾区居民的朋友和好帮手,实现前沿技术与本土文化的深度融合。因此,我们致力于解决AI‘拼装粤语’的痛点,让全世界的智能体都能说‘地道’的粤语,让岭南文化在数字时代走得更远。”

图片.png


下一步,重点实验室将继续推动优质粤语语料的常态化汇聚和规范化标注,加强标准建设、完善评测基准与搭建治理工具,迈出从科研成果到产业应用转化的关键一步;并以广东先行试点为基础,加强粤港澳大湾区语料共建、标准协同和场景合作。



推荐新闻
暂无信息