找到 1 篇关于此标签的文章
海外团队用 Qwen 3.5 微调出 35B 模型,声称综合表现接近 DeepSeek Pro 级别。但社区扒出评测方法含糊、benchmark 可能被污染,结论可信度被打上问号。