香港恒生大學( 恒生大學 )一項最新研究,利用具私隱保護的數據及大型語言模型(LLM),從更廣泛的對話語境理解網絡欺凌行為,為識別相關行為及建立更安全的數碼社群提供新方向。
恒生大學 發表兩項研究
該研究由 恒生大學 計算機科學系助理教授朱振輝博士領導,於2026年發表兩項相關研究。
- 第一項研究題為《Privacy-Aware Code-Mixed Cyberbullying Dataset for Session-Based Analysis》,發表於學術期刊《Data》(第11卷,第3期),建立了一個公開數據集,用於分析中英夾雜對話中的網絡欺凌現象。
- 第二項研究題為《Early Discovery of Cyberbullying Incidents in Multiparty Chinese-English Code-Mixed Colloquial Dialogue: A Generative AI Approach》,發表於《Intelligent Systems with Applications》(第30卷,2026年),開發了一個以LLM為基礎的框架,能在網絡欺凌行為逐漸形成的過程中及早識別。
傳統人工智能系統往往難以處理語碼混合語言
朱博士指出:「項目於數年前開展時,當時的技術尚未能分析涉及多名參與者的複雜網上對話,而LLM領域的最新進展,使此項工作變為可能。」
這種技術突破對香港尤為重要,因為本港網上溝通經常混合廣東話、書面中文、英文及本地網絡潮語。傳統人工智能系統往往難以處理這類語碼混合語言,而網絡欺凌本身亦可能以諷刺、嘲笑或間接攻擊的形式出現,未必使用明顯的冒犯字眼。
耗時逾六個月進行數據蒐集、清理及標註
為應對這些挑戰,研究團隊開發了「具私隱保護的中英夾雜網絡欺凌數據集」,包含從社交平台 X(前稱Twitter)蒐集的 14,000 多條經人工標註的帖子,分為 1,600 多段對話。原始資料集包含數十萬個帖文。團隊耗時逾六個月進行數據蒐集、清理及標註。
分析涉及多名參與者及多輪交流的完整對話
研究人員並非單單評估個別帖文,而是分析涉及多名參與者及多輪交流的完整對話。由LLM驅動的框架可識別受害者、施暴者及欺凌互動行為,同時考慮相關行為如何隨時間演變。這使系統能辨識重複針對、間接提及和不斷變化的人際關係,而這些情況往往容易被單一訊息層面的分析方法所忽略。
研究亦提出一套更有系統的方式,評估網絡欺凌的嚴重程度,考慮因素包括欺凌互動行為的頻率、施暴者人數,以及參與者之間的權力失衡。這類分析有助優先處理風險較高的個案,以便及早進行人為介入。
恒生大學 :人工智能並非要取代人類判斷
朱博士亦強調,人工智能並非要取代人類判斷:「人工智能可協助識別可能構成問題的內容,但人手審查仍然必要,因為沒有任何自動化系統是完全準確的。」網上語言變化迅速,數據集亦需定期更新及重新標註。
研究結果顯示,私隱保障與有效的人工智能研究可以並存;在某些情況下,減少訓練數據中的雜訊及偏誤,更可提升模型的表現。研究成果可支援未來在教育、社交媒體安全及數碼健康方面的研究及實際應用。
研究由文字擴展至圖像、迷因及其他多模態內容
展望未來,朱博士及其團隊計劃把研究由文字擴展至圖像、迷因(meme)及其他多模態內容。他說:「我希望科技可以協助減少網絡欺凌造成的傷害,並為更安全的數碼環境作出貢獻。」
更多相關內容:恒生大學研究|年輕人熟科技不等於識演說:眼神接觸、肢體表達最弱
免責聲明:本網頁刊載的所有投資技巧及分析,僅供參考用途。讀者作出任何投資決定前,要自行判斷及審慎處理,更要自行掌握市場最新變化。若不幸招致任何損失,概與本網頁及相關作者與受訪者無關,本網頁概不負責 。而本網頁所有專欄作者的觀點,不代表本媒體立場。