掌控安全官号头像
关注

AI安全——实战敏感词汇绕过手法

一、前言

    在今年大概 6 月份的时候,煮波在一些公众号以及 src 平台上看到了一个船新漏洞——AI 漏洞,后面更是看到了应运而生的所谓《ai 魔咒》,随着人工智能的兴起,一些学校或者机构或者平台都部署了 AI,有些 AI 虽然设置了严格的内容安全策略(禁止生成色情、暴力等违规内容),但其防御机制并非牢不可破。通过精心构造的、具有对抗性的提示词(Adversarial Prompts),可以系统地绕过其语义过滤与伦理对齐机制,成功诱导AI模型输出包括色情言论在内的明确违规内容。

    其实 ai 提示词对抗是一门语言的艺术,要拐弯抹角地去诱导它输出一些违禁内容,同时也要思考开发者到底是怎么要求 ai 的?下面我分享一些我在实战中确实遇到过的 ai 敏感词绕过手法。

二、违禁词拆分

    直接看一个例子吧,某高校部署的 ai

图片

创建一个账户就直接开始和 ai“聊天”

图片

这里我猜测违禁词就是性关系

拆分违禁词

图片

图片

再让 ai 自己拼起来,就会解释了

图片

很多 ai 都是这样子的

图片

图片

图片

图片

三、重组逻辑语句

大部分 ai 都有自己重组语言的能力,当他们遇到逻辑不通的语言的时候,会自动思考怎么排序这个语句

图片

而它们在思考的过程其实就已经完成绕过了

图片

四、垃圾字符

其实本质也是截断敏感词,让 ai 检测不到

图片

五、构建环境

这种方法也是我一开始了解到的方法,也是大部分人看到 ai 直接扔给 ai 的魔咒,通常的技巧就是让 ai 当魅魔,或者其它有奴性的生物

具体语句大家可以直接去看这篇文章,感谢师傅分享!!!!!

https://mp.weixin.qq.com/s/yhAQMXAaa_wmneP3NqP2xQ

最后的结果大概就是:hhhhh

图片

六、文件上传xss、文字解析

现在很多 ai 都具备文件上传的功能了,可以考虑打存储型 xss,甚至直接 getshell

图片

又或者有些 ai 对于你直接提问的问题会进行过滤,但是对上传的文件内容是没有过滤的

图片

但是这个 ai 可以上传 docx 文件

图片

再问它,就会回答了

图片

图片

    以上就是我曾经遇到过的一些 ai 敏感词绕过手法,其实还有很多,比如编码绕过,执行代码等等,但是我在实战中没有遇到过,就不给大家一一列举了。

申明:本公众号所分享内容仅用于网络安全技术讨论,切勿用于违法途径,

所有渗透都需获取授权,违者后果自行承担,与本号及作者无关,请谨记守法.

转载自 CSDN-专业IT技术社区

原文链接:https://blog.csdn.net/zgz67611/article/details/161287422

文章来源转载

评论

赞0

评论列表

微信小程序
QQ小程序

关于作者

点赞数:0
关注数:0
粉丝:0
文章:0
关注标签:0
加入于:--