返回首页
模型评测
找到 4 篇关于此标签的文章
Political CompassLocalLLaMA
大模型也要测政治立场了:Reddit 用户拿 Political Compass 跑了十几个模型
Reddit 用户 Thrumpwart 把十几款主流大模型丢进 Political Compass 测试,结果多数偏向经济左翼 + 社会自由象限。这事表面是社区玩票,背后是训练数据偏见与企业部署选型的真实风险。
8月29日2 分钟
OpenRouterOx Alph
Ox Alph 悄上 OpenRouter 无人认领 — 中国 AI 实验室开始'裸发'模型
'裸发'指模型上线时不公布实验室、不发技术报告。OpenRouter 这周出现的 Ox Alph 是最新一例,Reddit 用户猜是中国出品——反映中国大模型公司从'高调开源'分流出的一种新打法。
8月21日2 分钟
Qwen通义千问
Qwen 3.8 Max 最被低估的能力是'知道不该做什么' — 国产大模型卷向规划与克制
阿里通义千问发布 Qwen 3.8 Max。独立开发者在海外社区实测后给出的最高评价是:'最擅长知道什么不该做'。在参数军备竞赛回归的当下,这家中国公司押注的是模型的判断力与规划能力,值得所有为 AI 落地头疼的产品经理和架构师留意。
8月14日2 分钟
AnthropicClaude
Anthropic 被指用不实信息给 新模型造势 — AI 公司的 「发布会公关」正在透支可信度
Anthropic 旗下新模型 Claude Mythos 的发布被外部分析人士指出存在误导性 宣传,核心争议集中在性能对比数据的 呈现方式上。这不是孤立事件——AI 头 部公司在发布节点夸大或选择性披 露数据已成惯常操作,值得我们认真审 视这个行业的信息质量问题。
4月18日2 分钟