《電子技術應用》
您所在的位置:首頁 > 人工智能 > 设计应用 > 基于大语言模型的HTTP/HTTPS网络资产设备类型识别方法
基于大语言模型的HTTP/HTTPS网络资产设备类型识别方法
网络安全与数据治理
陈倩怡1,苏马婧1,2,陈紫璇1,2,张永奇1,2,马琰1,2
1.华北计算机系统工程研究所; 2.中国信息安全研究院有限公司
摘要: 针对传统基于静态指纹规则和判别式模型在复杂开放环境下泛化能力不足的现状,提出了一种基于大语言模型指令微调的 HTTP/HTTPS 网络资产设备类型识别方法。通过多源采集与多平台标签聚合的数据收集方案构造原始网络资产数据集,对该数据集进行关键特征优先保留的数据预处理,有效降低冗余噪声对模型输入的影响,然后通过融合HTTP/HTTPS 响应体、响应头、SSL 证书、端口及协议等多源异构特征,构建统一的序列化表示;在此基础上,利用 LoRA 技术对 LLaMA38BInstruct 模型进行参数高效微调,引导模型学习网络资产特征与设备类型之间的语义关联关系。实验结果表明,在包含 38 万条真实网络资产的测试集中,该方法在样本高度不均衡和长尾设备场景下仍能保持稳定性能,Weighted F1score 达到 0959 1,相比未微调模型效果显著提升。同时,模型推理吞吐量提高 6281%,验证了所提方法在大规模网络资产自动识别任务中的有效性与实用性。
中圖分類號:TP393文獻標志碼:ADOI:10.19358/j.issn.2097-1788.2026.05.001
中文引用格式:陳倩怡,蘇馬婧,陳紫璇,等. 基于大語言模型的HTTP/HTTPS網絡資產設備類型識別方法[J].網絡安全與數據治理,2026,45(5):1-10.
英文引用格式:Chen Qianyi, Su Majing, Chen Zixuan, et al. Device type identification of HTTP/HTTPS network asset based on large language models[J].Cyber Security and Data Governance,2026,45(5):1-10.
Device type identification of HTTP/HTTPS network asset based on large language models
Chen Qianyi1, Su Majing1,2, Chen Zixuan1,2, Zhang Yongqi1,2, Ma Yan1,2
1.National Computer System Engineering Research Institute of China; 2.China Information Security Research Institute Co., Ltd.
Abstract: To address the limited generalization ability of traditional network asset identification methods based on static fingerprint rules and discriminative models in complex and open environments, this paper proposes an HTTP/HTTPS network asset device type identification method based on instruction fine-tuning of a large language model. A multi-source data collection scheme with multi-platform label aggregation is designed to construct the original network asset dataset. A data preprocessing strategy that prioritizes key feature retention is applied to reduce redundant noise in model inputs. Multiple heterogeneous features, including HTTP/HTTPS response bodies, response headers, SSL certificates, ports, and protocols, are further integrated to construct a unified serialized representation. Based on this representation, the LoRA technique is employed to perform parameter-efficient fine-tuning on the LLaMA.3.8B.Instruct model, enabling the model to learn the semantic associations between network asset characteristics and device types. Experimental results on a test dataset containing 380 000 real-world network assets demonstrate that the proposed method maintains stable performance under highly imbalanced samples and long-tail device scenarios, achieving a Weighted F1.score of 0.959 1, which significantly outperforms the unfine-tuned base model. In addition, the model inference throughput is improved by 62.81%. These results verify the effectiveness and practicality of the proposed method for large-scale automated network asset device identification.
Key words : network asset identification; large language models; instruction tuning; multi-source heterogeneous features

引言

路由器、防火墻、網絡攝像頭、負載均衡設備等網絡設備類資產廣泛部署于公共網絡和專用網絡環境中,承擔著網絡轉發、邊界防護、數據采集與控制等關鍵功能,其安全性和運行狀態直接關系到網絡空間的整體安全態勢。因此,對網絡資產中設備類型及其廠商屬性進行準確、自動化的識別,對網絡空間測繪、安全風險評估以及漏洞關聯分析等工作具有重要意義。目前,網絡設備識別方法主要是基于靜態指紋庫規則匹配的方法,該方法在已知類型資產的識別中表現良好,但其依賴專家人工編寫的正則表達式指紋庫,維護成本高,泛化能力不足,在實際的開放網絡環境中,準確識別多廠商、多類型的設備面臨著嚴峻挑戰。首先,不同廠商、甚至同一廠商的不同產品線,其HTTP/HTTPS響應頭、HTML頁面結構及SSL證書均可能存在差異,導致指紋特征梳理工作量巨大;其次,特征的隱蔽與混淆日益普遍,現代網絡設備傾向于使用最小化的登錄頁面,或通過 JavaScript 動態加載內容,導致傳統的基于靜態關鍵詞匹配的方法難以提取有效識別信息;第三,新設備類型或型號出現速度快,基于人工指紋分析速度慢,難以快速發現新品種;此外,單一維度的特征往往不可靠,如端口可能被修改,Favicon可能缺失,Banner信息可能被管理員自定義掩蓋等,導致基于規則特征的方法識別準確性低。

針對上述問題,本文提出了一種基于大語言模型指令微調[1-2]的網絡資產設備類型識別方法,以實現HTTP/HTTPS協議網絡資產中的設備類型智能化識別。利用大語言模型強大的語義理解與上下文推理能力,將設備識別任務重構為語義理解與生成任務。具體而言,本文主要工作如下:

(1)提出了一種多源采集與多平臺聚合相結合的網絡資產數據收集方案:通過將主動探測[3]與被動監聽[4]相結合,并融合多種主流網絡資產測繪平臺的結果,構建了一個覆蓋范圍廣、標簽可靠性高的網絡資產數據集。

(2)設計了一種面向大語言模型的多維異構特征融合與Prompt[5]構建策略:針對網絡資產數據在結構形式和語義層次上的高度異構性,本文提出將非結構化的HTTP/HTTPS Body與結構化的SSL證書、Header鍵值對、端口及協議等特征進行統一序列化表達,并通過任務驅動的Prompt設計,將多源特征映射為大語言模型可理解的上下文輸入形式。

(3)探索并驗證了基于大語言模型的網絡設備識別新范式。本文將LLaMA[6]系列等通用大語言模型引入網絡資產設備識別任務,在少量高質量指令樣本的條件下,通過指令微調引導模型學習網絡資產特征與設備類型之間的語義關聯關系。實驗結果表明,該方法不僅能夠有效識別已知廠商與設備類型,在面對未知廠商或新型設備時也展現出良好的泛化能力,驗證了大語言模型在網絡資產識別場景中的有效性。


本文詳細內容請下載:

http://www.tom3567.com/resource/share/2000007085


作者信息:

陳倩怡1,蘇馬婧1,2,陳紫璇1,2,張永奇1,2,馬琰1,2

(1.華北計算機系統工程研究所,北京100083;

2.中國信息安全研究院有限公司,北京102200)

2.jpg

此內容為AET網站原創,未經授權禁止轉載。
主站蜘蛛池模板: 国产成人精品av在线| 日韩欧美精品久久| 性欧美精品一区二区三区在线播放V| 韩国成人一区| 91精品国产高清久久久久久| 欧美精品中文字幕一区二区| 亚洲欧洲国产精品久久| 国产剧情日韩欧美| 欧洲精品亚洲精品| 日韩一区国产在线观看| 亚洲综合在线做性V| 国产精品免费成人| 久久国产午夜精品理论片最新版本| www.精品av.com| 国产精品自拍合集| 91精品国产综合久久香蕉最新版| 俺去了亚洲欧美日韩| 欧美精品久久久久久久免费| 日本免费一区二区三区视频观看| 岛国视频一区| 国产精品狠色婷| 91精品视频免费观看| 欧美日韩免费高清| 日本不卡一区二区三区四区| 久久久久久亚洲精品不卡| 午夜免费日韩视频| 国产伦精品一区二区三区视频免费| 国产三区在线视频| 欧美激情国产精品| 久久亚洲精品欧美| 青青久久av北条麻妃黑人| 精品无码av无码免费专区| 中文精品一区二区三区| www.色综合| av免费观看国产| 欧美中日韩在线| 日韩一级黄色av| 国产精品成人播放| 亚洲欧美日韩综合一区| 欧美精品卡一卡二| 亚洲激情免费视频|