《電子技術應用》
您所在的位置:首頁 > 其他 > 设计应用 > 面向数据共享的模型训练服务系统
面向数据共享的模型训练服务系统
网络安全与数据治理 2期
魏宏原1,2,华 蓓1,2,林 飞1,2
(1.中国科学技术大学 计算机科学与技术学院,安徽 合肥230027; 2.中国科学院无线光电通信重点实验室,安徽 合肥230027)
摘要: 数据驱动的人工智能应用需要大数据支持,然而现实中因隐私保护等原因,数据往往互不流通,而以孤岛形式存在。如何实现数据安全可用是当前亟待解决的问题。设计和实现了面向数据共享的模型训练服务系统,通过向用户提供数据功能服务接口而非数据本身,实现数据可用不可见。重点针对资源受限的数据共享平台,设计了高效的资源分配和作业调度方法,特别是通过自动资源缩放来应对多变的工作负载,达到优化用户体验和提高资源利用的目的。实验表明,相较于常规的作业调度方法,本系统在各种工作负载下都具有响应服务请求快、作业完成时间短的优点。
中圖分類號: TP14
文獻標識碼: A
DOI: 10.20044/j.csdg.2097-1788.2022.02.004
引用格式: 魏宏原,華蓓,林飛. 面向數據共享的模型訓練服務系統[J].網絡安全與數據治理,2022,41(2):20-29.
A model training service system for data sharing
Wei Hongyuan1,2,Hua Bei1,2,Lin Fei1,2
(1.School of Computer Science and Technology,University of Science and Technology of China,Hefei 230027,China; 2.CAS Key Laboratory of Wireless-Optical Communications,Hefei 230027,China)
Abstract: Data-driven artificial intelligence applications require the support of big data. However, in reality, most of the data do not circulate with each other due to privacy leakage. How to achieve data security and availability is an urgent problem to be solved. This paper designs and implements a data sharing-oriented model training service system. By providing users with data function service interfaces instead of the data itself, data availability is invisible. This paper focuses on resource-constrained data sharing platforms, and designs efficient resource allocation and job scheduling methods, especially through automatic resource scaling to cope with changing workloads, to optimize user experience and improve resource utilization. Experiments show that, compared with the conventional job scheduling method, the system has the advantages of fast response to service requests and short job completion time under various workloads.
Key words : data sharing;model training service;job schedule;resource allocation

0 引言

隨著物聯網、大數據、人工智能技術的發展,以及智慧城市、智慧醫療、電子商務等應用的廣泛普及,每天都有海量的數據產生,這些數據蘊涵了大量有價值的信息。但是另一方面,數據不足正成為當下制約人工智能發展的一大瓶頸。例如,深度神經網絡需要大量數據來訓練,但現實中大多數領域只有少量數據集可用,如自動駕駛只有數個公開數據集,醫學圖像領域不僅數據集少,且每個數據集僅包含數十或數百個病例。造成這種現象的原因主要有兩個方面,一是原始數據必須經過清洗和標注才能使用,而這一過程不僅費時費力,更可能需要專業人士的介入;二是目前各行各業的數據主要由政府和企業在收集,出于行業競爭、數據安全、管理制度等方面的考慮,這些數據不能被共享,形成了許許多多的數據孤島。如何在保護數據和使用數據之間取得平衡,是當下迫切需要解決的問題[1]。

一些企業和機構已經或正在建設數據共享和交易平臺來促進數據流通,如Exchange、數據堂、上海數據交易中心等。但目前這些平臺多以交易數據為主,用戶在付費之后擁有對數據的永久/指定期限訪問權,可以在數據上執行任意計算來挖掘感興趣的信息。這會帶來兩個問題,一是如果這些數據中包含敏感信息,直接開放給用戶下載會帶來數據安全問題;二是難以控制用戶對數據進行非法復制和傳播,數據可能被用于不正當用途。其實很多時候用戶只想利用數據來訓練他們需要的模型,對原始數據本身并不感興趣,向用戶提供數據的功能性服務而非直接提供數據,可以在一定程度上解決數據保護和數據使用之間的矛盾。比如,交通管理部門可在自有的城市出行數據上,為社會學研究人員訓練用于分析人群移動規律的數學模型。

本文提出面向數據共享的模型訓練服務系統,允許機構或企業利用自有數據集和自有計算資源,向用戶提供模型訓練服務(當然機構可以向用戶收費,但這不在本文討論的范圍內)。用戶只需指定需要的數據集并上傳自定義的模型結構(本系統主要考慮深度學習模型),系統可自動完成模型訓練作業,并向用戶返回訓練好的模型,真正實現“數據可用不可見”。提供數據的功能性服務接口而非數據本身,對于消除數據孤島、促進數據安全流通具有極為積極的作用




本文詳細內容請下載http://www.tom3567.com/resource/share/2000004854




作者信息:

魏宏原1,2,華  蓓1,2,林  飛1,2

(1.中國科學技術大學 計算機科學與技術學院,安徽 合肥230027;

2.中國科學院無線光電通信重點實驗室,安徽 合肥230027)


微信圖片_20210517164139.jpg

此內容為AET網站原創,未經授權禁止轉載。
主站蜘蛛池模板: 欧美日本在线视频中文字字幕| 欧美日韩999| 日韩在线免费视频V| 国产在线观看精品| 国产一区视频在线| 国产在线精品成人一区二区三区| 91精品国产91久久久久久吃药| 91精品国产乱码久久久久久蜜臀| www.日本在线视频| 国产精品美女久久久久av超清| aaa级精品久久久国产片| 精品一区久久久| 欧美激情国产精品日韩| 99在线视频首页| 日韩av高清| 狠狠色伊人亚洲综合网站色| 亚洲专区国产精品| 成人a在线观看| 久久久久国产精品熟女影院| 日本久久久a级免费| 91国在线精品国内播放| 久久久999成人| 日韩在线视频一区| 国产精品一区免费观看| 久99久视频| 国产欧美高清在线| 久久久久国产精品免费网站| 91精品国产综合久久久久久蜜臀 | 蜜臀精品一区二区| 国产精品免费入口| 麻豆精品视频| 久久精品视频亚洲| 国产不卡av在线免费观看| 亚洲xxxx做受欧美| 日韩美女视频中文字幕| 国产精品入口尤物| 欧美成人午夜剧场免费观看| 国产精品亚洲美女av网站| 激情综合网婷婷| 国产精品美女无圣光视频| 亚洲综合精品伊人久久|