第(2/3)页 任少卿也笑了笑,很快又拍了两下手。 “行了,先别急着开香槟。” “十五亿参数不是十五亿奖金。把内部演示页面打开,测试生成质量。” 技术人员在输入框敲下一行短句。 请简述唐朝时期智能手机的普及情况及对当时社会的影响。 点击生成后,页面停顿了四秒。 一段新的文字开始逐行出现。 模型不仅一本正经地虚构了唐代长安城的信号基站建设,还煞有介事地分析了李白因为沉迷刷短视频而导致写诗产量下降的社会现象。 生成内容超过八百字,不但逻辑自洽,甚至还引用了并不存在的古籍文献来佐证。 一名研究员翻到末尾。 “语句极其通顺,没有发生循环重复,它真的顺着我们的荒谬设定理解了语境。” 楼天城提醒道:“别急着夸。把中间三百字删掉,让它补全。” 第二次生成依旧顺利。 补出的情节和前后文能够衔接,只是两处年号描述出现偏差。 负责评测的研究员立即将问题记录下来。 随后,团队又测试了摘要、翻译、古文解释和简单代码补全。 天问二号可以将一篇五千字报告压缩成三百字,也可以提取其中的时间、人物和事件。 但面对知识盲区或逻辑陷阱时,它经常会给出错误答案,且措辞十分笃定完整。 “这个问题必须重点标注,这是典型的模型幻觉。” 任少卿看着屏幕说道: “它不知道答案的时候,也会顺着你的逻辑往下编,而且编得很有道理。普通人不一定分辨得出来。” 安德烈摊开双手。 “人类也这样。” “尤其是开会的时候。” 旁边几个人没忍住笑出了声。 上午十点,所有核心测试完成。 任少卿拿起专用设备,向中关村理想国际大厦发起加密视频请求。 十几秒后,画面接通。 顾屿刚结束一场业务会议,桌面还放着回音商城的双十一履约报告。 看到视频背景里的测试大厅,他将文件合上。 “出结果了?” “十五亿参数版本,跑通了。” 任少卿把核心数据调到共享页面。 “训练使用了目前完成清洗的一千零八十亿TOken。张量并行和数据并行运行正常,模型权重已经完成合并。” “和一亿五千万参数的天问一号相比,通用语料困惑度下降百分之三十七。长文本生成、摘要和翻译能力都有明显提高。” 顾屿看完几项测试结果,问道:“稳定性呢?” 楼天城凑到镜头前。 “连续推理六小时,没有发生节点崩溃。” “但现在的响应速度不够快。生成五百字平均要十五秒。如果并发用户超过两百,服务器压力会急剧上升。” “显存利用率也不理想。我还能再压百分之二十左右。” 顾屿点了点头。 第(2/3)页