第(2/3)页 天问不仅修改了语句,还主动删除了三段重复内容,将两千多字压缩到八百字。 学生随后要求保留原本的口吻,不要写得过于正式。 第二版很快生成,甚至保留了两处年轻人常用的口语表达。 这条视频被大量高校账号转发。 【学生会宣传部连夜申请封禁天问。】 【以后写活动总结终于不用凑字数了。】 到了晚上八点,相关视频的累计播放量已经过亿。 引力热搜榜上,前十名被天问占了四个。 【天问大语言模型】 【机器也会写故事】 【回响十五亿参数模型开放测试】 【程序员现场考天问】 回音平台上,大量数码博主开始逐帧分析现场视频。 有人统计了天问的响应时间。 普通文字任务通常在三到六秒内开始输出,涉及长文本分析时,等待时间会增加到十秒以上。 也有人发现,十台体验设备同时工作后,生成速度出现过明显下降。 这些细节反而增加了可信度。 如果只是提前录制好的展示程序,不该出现算力占用升高、回答质量波动和上下文遗忘等问题。 一名参加大会的硬核科普博主,在引力社区上传了一张现场测试的对话截图。 截图里,他没有让天问长篇大论,而是输入了一个简短却暗藏逻辑陷阱的纯文本问题。 “房间里有五个人。甲在看书,乙在下棋,丙在睡觉,丁在写字。请问戊在干什么?” 这是一个经典的隐性条件推理题。 传统的搜索引擎遇到这种问题,只会抓取这几个动作的关键词,给出一堆毫不相干的网页链接。 但天问在停顿了四秒后,在屏幕上逐字给出了回复。 “戊在和乙下棋。因为下棋通常需要两个人进行,而甲、丙、丁都有明确的单人活动,所以戊是乙的对手。” 这名博主在截图上方配了一段评价: “能力边界很明显,它现在还无法处理极其复杂的长文本嵌套,但对于这种简短的常识推理,它展现出了让人后背发凉的思考能力。它不仅读懂了字面意思,还补全了人类没有写出来的隐性条件。” 评论区没有因为问题简短而冷下来。 【终于看到正常的硬核评测了,前面那些全在写情书。】 【这才是最恐怖的,它知道下棋需要两个人,它具备了人类社会的常识!】 【现在就开始担心人类智力被取代是不是太早了?】 【不早,先担心自己的饭碗吧。】 然而,天问登上热搜不到一个小时,质疑内容也开始集中出现。 数十个账号同时发布长文,标题几乎一个风格。 《所谓大语言模型,不过是一场精心准备的科技魔术》 《十五亿参数制造出来的资本神话》 《回响天问疑似后台真人回复,现场测试全是托》 第(2/3)页