
文章核心內容、創新點總結及關鍵部分翻譯一、文章主要內容總結本文針對移動應用商店人工審核流程繁瑣、現有自動化工具靈活性差且難以處理多源異構數據等問題,提出了基于大型語言模型(LLMs)的移動應用風險分析系統Mars,旨在實現可擴展、可解釋的自動化風險識別與分析。1. 研究背景與問題移動應用商店每日接收大量應用提交,其中部分存在廣告彈窗、惡意軟件、應用變形等安全風險,但當前審核依賴人工與半自動化工具,存在效率低、成本高、易出錯的問題。現有自動化工具多針對單一風險類型,數據來源單一,難以處理高維異構數據;直接應用LLMs則面臨上下文窗口限制(無法處理多源數據)與幻覺問題(輸出不實信息,導致誤判)。2. Mars系統設計Mars采用“離線知識準備+在線實時分析”兩階段流程:離線階段:構建風險識別樹(Risk Identification Tree),整合兩類關鍵信息——基于歷史下架應用數據的“數據驅動信號”(如同類風險應用的共性模式)和領域專家提煉的“知識驅動規則”(如異常分發行為)。該樹為層級結構,根節點對應風險類別(如廣告彈窗),葉節點為風險相關特征,可過濾無關數據,降低LLM輸入維度。在線階段:新應用提交后,先通過風險識別樹篩選無關特征,再將提取的關鍵指標輸入LLM進行風險判定;