內容簡介:正則表達式匹配技術在人工智能時代背景下扮演著重要角色,尤其在數據清洗與數據抽取領域,可為大語言模型訓練所需的高質量數據處理提供技術支撐。然而,傳統正則表達式匹配算法存在性能瓶頸,限制了其應用范圍。針對此問題,提出一種基于可信區域的高性能正則表達式匹配算法,命名為YJJFA算法。該算法通過對狀態轉移表劃分成最優可信區域與非信任區域,減少需要處理的狀態轉移表輸入字符數量,并借助非內存訪問的非信任字符集向量比較以實現信任字符低時間消耗處理。實驗結果表明,YJJFA算法在L7filter規則上的吞吐率達17.88~53.81Gb/s,較原始DFA算法性能提升了一個數量級。
