news 2026/4/16 14:34:24

使用Minimind从0~1进行大模型预训练、SFT、RLHF

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
使用Minimind从0~1进行大模型预训练、SFT、RLHF

项目地址

资源:Tesla v100 32GBx8

测试原模型效果

python eval_llm.py --load_from ./MiniMind2

1. 预训练

预训练数据集
pretrain_hq.jsonl

{“text”: “<|im_start|>鉴别一组中文文章的风格和特点,例如官方、口语、文言等。需要提供样例文章才能准确鉴别不同的风格和特点。<|im_end|> <|im_start|>好的,现在帮我查一下今天的天气怎么样?今天的天气依据地区而异。请问你需要我帮你查询哪个地区的天气呢?<|im_end|> <|im_start|>打开闹钟功能,定一个明天早上七点的闹钟。好的,我已经帮您打开闹钟功能,闹钟将在明天早上七点准时响起。<|im_end|> <|im_start|>为以下场景写一句话描述:一个孤独的老人坐在公园长椅上看着远处。一位孤独的老人坐在公园长椅上凝视远方。<|im_end|> <|im_start|>非常感谢你的回答。请告诉我,这些数据是关于什么主题的?这些数据是关于不同年龄段的男女人口比例分布的。<|im_end|> <|im_start|>帮我想一个有趣的标题。这个挺有趣的:“如何成为一名成功的魔术师” 调皮的标题往往会吸引读者的注意力。<|im_end|> <|im_start|>回答一个问题,地球的半径是多少?地球的平均半径约为6371公里,这是地球自赤道到两极的距离的平均值。<|im_end|> <|im_start|>识别文本中的语气,并将其分类为喜悦、悲伤、惊异等。\n文本:“今天是我的生日!”这个文本的语气是喜悦。<|im_end|>”}

进行预训练
torchrun --nproc_per_node 8 train_pretrain.py

测试预训练的效果
python eval_llm.py --weight pretrain

2、SFT

SFT数据集
sft_mini_512.jsonl

{“conversations”: [{“role”: “user”, “content”: “请告诉我在中国古代的“四大发明”是什么?”}, {“role”: “assistant”, “content”: “中国古代的“四大发明”是指造纸术、印刷术、火药和指南针。这四项发明对世界文明的发展产生了深远的影响:\n\n1.造纸术:据史书记载,东汉时期的蔡伦改进了造纸工艺,使得纸张的生产更加便捷、成本更低,质量也更加优良。这一发明极大地促进了文化的传播和保存。\n\n2.印刷术:中国古代的印刷术最早可以追溯到唐代的雕版印刷,到了宋代发展出了活字印刷技术。印刷术的发明极大地促进了知识的传播,降低了书籍的成本,对教育和文化的发展起到了重要的推动作用。\n\n3.火药:火药最初是在唐代被发现的,最初可能用于医疗或炼金术。到了宋代,人们开始将火药用于军事目的,发明了各种火器。火药的发明改变了战争的面貌,对世界军事技术的发展产生了重大影响。\n\n4.指南针:指南针最初在中国被用于风水测量,后来逐渐发展成为航海导航的重要工具。这一发明极大地促进了海上航行技术的发展,对于新航路的开辟和世界地理大发现起到了关键作用。\n\n这四项发明不仅在中国历史上占有重要地位,而且对全世界的科技进步和文明发展都产生了深远的影响。”}]}

进行SFT
torchrun --nproc_per_node 8 train_full_sft.py

测试SFT 的效果
python eval_llm.py --weight full_sft

3、PPO

PPO数据集
rlaif-mini.jsonl
{“conversations”: [{“role”: “user”, “content”: “列出五个基本的人格理论,并分别以一句话概括。”}, {“role”: “assistant”, “content”: “空”}]}

# 进行PPO训练
torchrun --nproc_per_node 8 train_ppo.py

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/4/8 12:41:15

最新SRC漏洞挖掘思路手法,说说我对SRC漏洞挖掘的思路技巧

这段时间挖掘了挺多的SRC漏洞&#xff0c;虽然都是一些水洞&#xff0c;也没有一些高级的漏洞挖掘利用手法&#xff0c;但是闲下来也算是总结一下&#xff0c;说说我对SRC漏洞挖掘的思路技巧。 很多人可能都挖过很多漏洞其中包括一些EDU或者别的野战&#xff0c;但是对于SRC往…

作者头像 李华
网站建设 2026/4/16 13:44:10

如何在 C# 中重命名 Excel 工作表并设置标签颜色

在日常工作中&#xff0c;我们经常需要处理大量的 Excel 文件。当文件中的工作表数量众多&#xff0c;或者需要根据特定规则&#xff08;如数据内容、日期等&#xff09;来组织时&#xff0c;手动逐个修改工作表名称和设置标签颜色不仅效率低下&#xff0c;还极易出错。想象一下…

作者头像 李华
网站建设 2026/4/15 16:29:49

LobeChat尾款催付提醒话术

LobeChat尾款催付提醒话术 在电商运营的日常中&#xff0c;尾款催付是一项高频但又极易出错的任务。传统方式下&#xff0c;客服需要手动查询订单状态、复制客户信息、套用模板生成提醒消息——流程繁琐、效率低下&#xff0c;还容易因语气不一致或信息遗漏引发客户不满。随着大…

作者头像 李华
网站建设 2026/4/16 11:13:49

vue基于springboot的广告服务型互联网平台

目录已开发项目效果实现截图开发技术系统开发工具&#xff1a;核心代码参考示例1.建立用户稀疏矩阵&#xff0c;用于用户相似度计算【相似度矩阵】2.计算目标用户与其他用户的相似度系统测试总结源码文档获取/同行可拿货,招校园代理 &#xff1a;文章底部获取博主联系方式&…

作者头像 李华
网站建设 2026/4/16 11:05:39

“AIE未来视听领袖峰会”在澳门举办,聚焦AI+AR新范式

12月4日&#xff0c;作为首届全球智能机械与电子产品博览会&#xff08;AIE&#xff09;的同期活动&#xff0c;“AIE未来视听领袖峰会”在澳门威尼斯人金光会展中心举行。会议以“视听全球&#xff0c;音画未来”为主题&#xff0c;汇聚300余位来自全球的行业领袖、院士专家、…

作者头像 李华