返回首页
RLHF
找到 4 篇关于此标签的文章
OpenAIAnthropic
AI 数据工人集体隐身 — 上百万标注员撑起大模型却极少上头条
Lobsters 讨论帖重新指向一个被遗忘的事实:今天所有大模型背后,是数百万分布在全球南方的数据标注工人,时薪常低于 2 美元。我们关心的是这件事为什么到今天才被系统性讨论。
6d ago2 分钟
LLMRLHF
AI 满嘴'minted''escape hatch':硅谷腔病有解药
Reddit r/LocalLLaMA 这周出现一则高赞吐槽:用户列举 LLM 用'minted'替代'created'等怪现象。编辑部研究为什么 AI 学会装腔作势,给出几条实用解药。
Aug 222 分钟
DeepSeekQwen
中美大模型都在抄同一套训练流水线 — 真正决定能力的,不是预训练
我们注意到一个被低估的事实:预训练吃掉 90% 算力,但决定模型聪明程度的反而是那个只占 5% 的中训阶段。一篇掘金技术长文拆解了 DeepSeek、Qwen、Kimi 这条正在被悄悄标准化的流水线。
Aug 142 分钟
PPORLHF
大模型听话又不发疯全靠 PPO,ChatGPT 调教术终于被看透
PPO 是让大模型按人类偏好学习且不崩溃的核心算法。它像温和教练限制步伐,保障 AI 安全落地,值得企业选型时重点关注。
May 12 分钟