讯飞星火V3.5实测体验:多维度领先国内水平 与GPT-4不分伯仲

首页 > 科技

讯飞星火V3.5实测体验:多维度领先国内水平 与GPT-4不分伯仲

来源:幽默段子 发布时间:2024-02-02 11:36

2024年1月30日,科大讯飞发布了首个基于全国产化算力平台训练的全民开放大模型——讯飞星火V3.5,相比上一代模型在语言理解、文本生成、知识问答、逻辑推理、数学能力、代码能力和多模态能力等七个方面进行了全面进级。特别是在语言理解、数学能力方面已经超过 GPT-4 Turbo,进一步夯实了中国“最聪明”的大模型的地位。


  在发布会现场,科大讯飞工作人员也展示了与讯飞星火V3.5的人机交互体验,它不仅能够清晰理解所说的含义,同时还能够实现多轮对话,完全感觉就是在“唠嗑”一般,并且还让讯飞星火V3.5有了一定的情绪感知,完全体会不到机器人的冰冷。

  当主持人表达想要去哈尔滨旅行的想法后,讯飞星火V3.5快速为主持人定制了旅游攻略,还催促他赶快买票,因为此时正是春运时期,所有票都非常紧俏,这样的逻辑能力也是相当给力的。


  所以在全程看完讯飞星火V3.5的发布会后,笔者就迫不及待的想要体验一下它的实力,并且将直观的与当下同样火爆的ChatGPT 最 新的 GPT-4、文心一言4.0几个大模型进行比较,重点从语言理解、数学能力、多模态、办公支持等多个维度来具体分析讯飞星火V3.5的真实表现。(注:目前除了讯飞星火V3.5外,其它两个对比大模型都是需要付费的)

  语言理解

  题目:大舅去二舅家找三舅说四舅被五舅骗去六舅家偷七舅放在八舅柜子里九舅借十舅发给十一舅工资的1000元。

  问:1、究竟谁是小偷?2、钱本来是谁的?

  其实这道题主要考验的是一个关系逻辑推理问题,我们看看几个大模型都是如何回答的。

  讯飞星火V3.5


  GPT-4


  文心一言


  从对比中看出,目前各个大模型其实都是有一定逻辑推理能力的,但是在绕来绕去的文字里,只有讯飞星火V3.5给出了正确的结果,四舅偷了钱,钱是九舅的。而且讯飞星火V3.5的分析也是非常简洁明了,让用户很快就能明白其中关键缘由。

  下面再出一道关于空间逻辑的题目。

  题目:我是一名在校学生,图书馆在学校的中心位,实验楼在图书馆的南边,学生活动中心在学校的北边,教学楼和体育馆分别在学生活动中心的东边和西边,食堂在图书馆的东边,现在我在教学楼上完课需要去实验楼做实验,应该怎么走?


  根据提示,笔者简单的画了一张草图,利便大家对照各个大模型的路线来判断对错。

  讯飞星火V3.5


  GPT-4


  文心一言


  对比之下,三个大模型的回答均是正确的,但是作为使用者,我更希望得到精简的答案,能够快速告诉我具体路线。所以从回答的方式来说,笔者更喜欢讯飞星火V3.5和GPT-4,而文心一言有点啰嗦了。

  数学能力

  题目:河上有抛物线型拱桥,当水面距拱顶5米时,水面宽度为8米,一小船宽4米,高2米,载货后船露出水面的部分高0.75米,问水面上涨到与抛物线拱顶距多少时,小船开始不能通行?

  讯飞星火V3.5


  GPT-4


  文心一言

上一篇:世界上最“霸... 下一篇:个体工商户属...
猜你喜欢
热门阅读
同类推荐