多模态多轮对话安全对齐:从智能体交互到战略对齐
原始标题 / Towards Multi-modal Multi-turn Safety: From Agentic Interaction to Strategic Alignment
现有对齐方法主要针对恶意视觉问答对,难以防范多轮对话中的渐进式对抗攻击。该研究提出了MINT-Safe数据集和TAD-Align框架,通过多轮感知的双目标奖励函数动态识别并加权不安全回合,显著降低攻击成功率,同时提升安全性和有用性。
01 摘要
本研究指出多模态大模型在多轮对话中存在安全风险,现有对齐方法不足。作者通过多智能体交互构建了多轮视觉对话数据集MINT-Safe,并提出TAD-Align框架,利用基于rollout的安全分数方差动态识别不安全回合并加权优化,在Qwen2.5-VL-7B-Instruct和LLaVA-NeXT-7B上实验显示攻击成功率降低超过10%,安全性和帮助性分别提升至少8%和13%。
02 关键点
- 提出MINT-Safe数据集:11,270个多图像对话和500个拒绝VQA对,用于多轮视觉安全对齐
- TAD-Align框架采用回合感知双目标奖励函数,动态识别安全行为不一致的回合并自适应加权
- 实验证明多个模型上攻击成功率降低超10%,安全性和帮助性显著提升
- 发现多轮交互使对抗者能逐步重建有害意图,绕过单轮安全约束
回到一手来源
阅读原文 ↗AI GENERATED SUMMARY / DISCOVERED BY ARXIV CS.CL