### 问题/痛点描述 精度测评,对比不同产品的模型精度时,存在精度和论文、其他产品无法完全对齐的场景,但是看具体的回答也没有明显的异常,希望通过输出分布来看模型之间推理行为的差异 ### 建议方案 1、精度测评提供输每个case的输出长度,给出输出长度的分布 2、部分case存在截断,截断后精度无法获取的case,单独能够标注出来 ### 备选方案 _No response_ ### 预期价值 1、需要和其他产品形态精度对比 2、评估token消耗量 ### 参与意向 - [ ] 我愿意参与此功能的开发或测试
问题/痛点描述
精度测评,对比不同产品的模型精度时,存在精度和论文、其他产品无法完全对齐的场景,但是看具体的回答也没有明显的异常,希望通过输出分布来看模型之间推理行为的差异
建议方案
1、精度测评提供输每个case的输出长度,给出输出长度的分布
2、部分case存在截断,截断后精度无法获取的case,单独能够标注出来
备选方案
No response
预期价值
1、需要和其他产品形态精度对比
2、评估token消耗量
参与意向