罗马乌尔都语仇恨言论分类大比拼:LoRA微调竟比提示工程更省力?
Hate Speech Classification In Roman Urdu: A Comparative Study On Parameter Efficient Fine-Tuning And Prompt Engineering
arXiv AI (cs.AI) 多模态论文方法 🕐 08-25 12:00

📖 AI 总结

该研究聚焦于罗马乌尔都语(一种低资源语言)中的仇恨言论分类问题。由于该语言语法不规范、句子结构多变且拼写差异大,加之可用数据有限,传统方法面临挑战。研究系统比较了三种前沿技术:基于LoRA的参数高效微调(PEFT)、提示词调优以及提示工程,并设计了四组实验。实验分别考察了零样本直接推理、PEFT微调、混合与手工提示词调优,以及零样本/少样本提示工程的效果。研究旨在确定在数据稀缺条件下最有效的分类策略,同时兼顾计算效率。该工作对低资源语言的自然语言处理应用具有参考价值,为在算力受限环境下开展仇恨言论检测提供了实证依据。

🔑 关键词速览

Roman Urdu用拉丁字母书写的乌尔都语,广泛用于巴基斯坦和海外乌尔都语社区,属于低资源语言。
Parameter-Efficient Fine-Tuning (PEFT)一种微调方法,只更新模型的一小部分参数,从而降低计算成本。
LoRA一种参数高效微调技术,通过低秩分解减少可训练参数数量。
Prompt Tuning一种通过调整输入提示(prompt)来适应模型的方法,通常只训练少量提示参数。
Prompt Engineering通过精心设计指令或示例来引导模型输出,无需额外训练。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅