我们的服务符合学术规范和道德
专业 高端让您使用时没有后顾之忧

人民论坛·学术前沿2024年第13期:加快建设人工智能大模型中文训练数据语料库

来源:期刊VIP网 时间:


作者:张凌寒;

单位:中国政法大学数据法治研究院;

摘要:人工智能大模型产业发展的三要素为算法、算力与数据,其中训练数据语料库的质量直接决定了人工智能大模型的能力。中文数据语料总量相较英文数据语料严重不足,同时存在数据采集行为违法风险较高、公共数据开放利用不足、线下结构化数据版权制度不协调、商业采购与合作数据无法确定数据权属等障碍,其已成为制约人工智能发展的制度瓶颈。发展我国人工智能大模型产业可通过司法判例明确网络数据来源合法性认定条件,协调版权规则确定线下数据使用合理性制度边界,构建开放机制满足公共数据参与语料库建设需求,协同促进跨领域数据流通交易规则建立供给激励,多方破除制度障碍以应对产业发展需求。

关键词:人工智能大模型;;训练数据;;语料库建设;;版权制度;;公共数据

基金资助:国家社会科学基金重点项目“生成式人工智能的法律定位与分层治理研究”的阶段性研究成果,项目编号:23AFX009