职贝云数AI新零售门户
标题:
刚刚,新版DeepSeek-R1正式开源!直逼o3编程强到离谱,一手实测来了
[打印本页]
作者:
xSAkNE
时间:
6 天前
标题:
刚刚,新版DeepSeek-R1正式开源!直逼o3编程强到离谱,一手实测来了
DeepSeek又末尾搞事了。
新版DeepSeek-R1正式开源了!
DeepSeek-R1-0528模型权重已上传到HuggingFace,不过模型卡暂未更新。
项目地址:https://huggingface.co/deepseek-ai/DeepSeek-R1-0528/tree/main
时隔4个月,DeepSeek-R1完成了超退化,编码才能强到离谱,而且思索工夫更长了。
据称,新模型基于DeepSeek-V3-0324训练(参数为660B)。
(, 下载次数: 0)
上传
点击文件名下载附件
经典物理模拟测试中,DeepSeek-R1新旧版本的对比
在LiveCodeBench基准上,DeepSeek-R1-0528功能几乎与o3-mini(High)和o4-mini(Medium)实力相当,一举超越了Gemini 2.5 Flash。
(, 下载次数: 0)
上传
点击文件名下载附件
有网友称赞,DeepSeek-R1可以像o3一样纠正思想链,并且像Claude一样创造性停止世界构建。
(, 下载次数: 0)
上传
点击文件名下载附件
可以说,这是属于开源模型的宏大成功!
(, 下载次数: 0)
上传
点击文件名下载附件
不用R2,直接对标SOTA
此次,DeepSeek-R1-0528更新核心亮点,网友做了一个稀释版的总结:
能像谷歌模型一样深度推理
文本生成优化:更自然,格式更佳
独特的推理风格:不只快,而且更缜密
支持长时思索:单义务处理时长可达30-60分钟
(, 下载次数: 0)
上传
点击文件名下载附件
思索工夫更长,成为了全网讨论最多的一点。有网友实测后,R1思索时长超过了25分钟。
(, 下载次数: 0)
上传
点击文件名下载附件
另外,这似乎是唯逐一个能持续正确做对「9.9 - 9.11是多少」的模型。
(, 下载次数: 0)
上传
点击文件名下载附件
(, 下载次数: 0)
上传
点击文件名下载附件
编程才能强到爆网友实测显示,新版DeepSeek-R1在编程方面几乎不可思议!
AI圈大佬「karminski-牙医」用同一个prompt测试了DeepSeek-R1-0528和Claude 4 Sonnet后发现。
不管是光线照射在墙上构成的漫反射,还是球在撞击后的运动方向,亦或是控制面板的美观程度,这一把R1稳赢。
(, 下载次数: 0)
上传
点击文件名下载附件
(, 下载次数: 0)
上传
点击文件名下载附件
网友Alex的测试也显示出,DeepSeek-R1在前端编码的才能上超越了Claude 4 Sonnet。
(, 下载次数: 0)
上传
点击文件名下载附件
(, 下载次数: 0)
上传
点击文件名下载附件
(, 下载次数: 0)
上传
点击文件名下载附件
网友Haider.则是让模型构建一个单词评分系统。R1简要思索后,就立刻出了关于代码和工作测试的两个文件,第一次运转就完美无瑕。
(, 下载次数: 0)
上传
点击文件名下载附件
此前,o3是独一能完成这个义务的模型。而如今,R1可谓是完成这个义务的最佳模型。
留意,R1的表现之所以如此惊人,是由于它前往的两个文件在第一次都能运转良好,不用编辑,不用重试,这极其少见。
由于此前的大多数模型,要么会在边缘状况下终端,要么会做得太复杂,要么短少适当的测试覆盖率。
(, 下载次数: 0)
上传
点击文件名下载附件
和Gemini高能PK
还有人将DeepSeek-R1与Gemini 2.5 Pro停止了对标。同一个提示下,它们各自的表现如何?
(, 下载次数: 0)
上传
点击文件名下载附件
首先是深度研讨的才能,给出「研讨微剂量服用裸盖菇素对长期认知的影响,需援用学术来源」提示。
这一把Gemini的呼应更快,援用了牢靠的研讨文献,并且答案结构明晰。
再来看看它们搜索+对比才能如何?提示模型用实时来源列出全民基本支出(UBI)的五大优点和缺陷。
这时,Gemini 2.5 Pro和DeepSeek R1表现都不错,打成平手。
(, 下载次数: 0)
上传
点击文件名下载附件
(, 下载次数: 0)
上传
点击文件名下载附件
Prompt: List top 5 pros/cons of Universal Basic Income using live sources.
上下滑动查看
再让模型为AI SaaS工具制定TikTok增长策略,两款模型再次打成平局。
在智能体义务规划方面,让Gemini和DeepSeek一同设计一个残缺的市场调研智能体,包含工具链、用户角色和流程交接,结果是Gemini生成一张信息图,而DeepSeek略胜一筹。
由此,大家对DeepSeek-R2的等待值也是拉满了。
一手实测来了
新版DeepSeek-R1的才能经过我们实测,虽然是一次「小版本」更新,但是功能得到了「史诗级」的加强。
尤其是编程才能,感觉曾经超过或者足以媲美Claude 4和Gemini 2.5 Pro,可以说一切提示都是「一把过」,不需求任何修正!并且可以在网页端直接运转,展现效果。
首先是制造一个「新智元」字体在宇宙中旋转的3D动画,完成度相当之高。
(, 下载次数: 0)
上传
点击文件名下载附件
对于简单义务,DeepSeek-R1的思索工夫分明延长,不再像以前对简单义务也疯狂思索。
设计一个新智元的官方网站,对于这种相对容易的义务,DeepSeek-R1-0528只需求10s的思索工夫。
(, 下载次数: 0)
上传
点击文件名下载附件
可以分明感觉到,这次DeepSeek-R1新版本的思索过程愈加波动。
以模拟一个太阳系运转为例,还要求行星比例大小与实践相反,能看到DeepSeek-R1-0528的思索过程曾经趋近于「完美」。
(, 下载次数: 0)
上传
点击文件名下载附件
最后,再给DeepSeek-R1-0528上点强度,要求演示篮球落地后的弹跳过程,并且要完美遵照理想中物理规律。
(, 下载次数: 0)
上传
点击文件名下载附件
最终DeepSeek的成果还贴心的设计了参数控制面板,以及速度方向指示,是真的很强,以上一切代码都是提示之后一遍过,没有任何的Debug过程。
对于相似「华容道」的多步骤思索成绩,DeepSeek-R1-0528的表现也非常完美,
比如「一位农夫要带一只狐狸、一只鹅和一袋豆子过河。船每次只能载他和一样物品。假如农夫不在场,狐狸会吃掉鹅,鹅会吃掉豆子。请问农夫该如何安排过河,才能确保一切物品安全?」这种复杂推理成绩,DeepSeek-R1还可以给出核心成绩所在。
(, 下载次数: 0)
上传
点击文件名下载附件
最令我感到震惊的是,这次的「思索」才能似乎停止了机密加强。
我给他了一个非常无厘头的族谱成绩:「我的妈妈的爸爸的儿子的侄女的孙子的爷爷的舅舅的外孙女的姑姑,是我的谁,你能画出关系族谱图吗?」
以下过程经过3倍加速,可以看到DeepSeek-R1真的在经过数学的符号化方式在停止思索。
(, 下载次数: 0)
上传
点击文件名下载附件
并且最后还真让他分析出了却果,几乎震惊!这么长的思索链条都没有断。
另外值得一提的是,这次的思索过程并没有遇到服务算力不够的状况,看来DeepSeek有针对性的提高了算力,毕竟如今是模型刚发布后的高峰「测评」期。
参考材料:https://chat.deepseek.com/https://x.com/i/status/1927770337170592033https://x.com/Yuchenj_UW/status/1927828675837513793https://x.com/chetaslua/status/1927716608384094545https://x.com/AiBattle_/status/1927824419478536405https://huggingface.co/deepseek-ai/DeepSeek-R1-0528/tree/main
来源:新智元版权属于原作者,若触及侵权。请联络删除,谢谢!
欢迎光临 职贝云数AI新零售门户 (https://www.taojin168.com/cloud/)
Powered by Discuz! X3.5