Longcat-2.5-preview 先固定自己的测试题 / 别急着看别人的评分

文章导读
看了一圈榜单和评测,仍然不知道哪一条评分和自己每天要做的事有关,通常不是评价本身写错了,而是题单不属于自己。可以先把自己的题目固定下来:从每周真会做的任务里抽 5 到 8 道,逐题写明输入、必须出现的信息和不接受的说法,用固定问法一次只跑一题,按通过、部分通过、不通过三档打分并各写一句理由,最后再拿公开评价做对照,而且只比同类任务。
📋 目录
  1. A 从每周真会做的任务里挑出候选题目
  2. B 给每题写明输入、必须出现的信息和不接受的说法
  3. C 固定问法,一次一题,记录原始输出
  4. D 用三档打分并各写一句理由
  5. E 把自己的结果和公开评价对照,只比同类任务
A A

看了一圈榜单和评测,仍然不知道哪一条评分和自己每天要做的事有关,通常不是评价本身写错了,而是题单不属于自己。可以先把自己的题目固定下来:从每周真会做的任务里抽 5 到 8 道,逐题写明输入、必须出现的信息和不接受的说法,用固定问法一次只跑一题,按通过、部分通过、不通过三档打分并各写一句理由,最后再拿公开评价做对照,而且只比同类任务。

适用场景:准备用 Longcat-2.5-preview 处理周报、会议记录、数据说明这类日常文本时,公开评分只能当参照。操作动作:先抽 5 到 8 道每周真会做的题,每题写清输入、必现信息、不接受说法三栏,固定问法一题一跑,三档打分各写一句理由。验证方式:用关键词在原始输出里检索,逐条核对三栏。风险边界:题单只对自己有效,别拿它推断别人的结论。

从每周真会做的任务里挑出候选题目

题目要从自己的工作流里长出来,而不是照着别人的题型抄。常见的抽取范围包括:周报整理、会议记录改写、数据说明撰写、把内部工单回复改写成一段可对外发送的说明、把零散要点整理成一条通知。判断一道题值不值得进题单,只看一件事——下周你是不是还会做同样的动作。会重复做,就留下;只是偶尔来一次,先不进。

数量上建议先固定 5 到 8 道,覆盖两三种任务类型即可,题太多会拖慢每一轮的核对。每题都要保留原始材料:把当时用的会议记录、周报草稿、表格说明复制到一个固定目录,命名成 task-01-input.md 这样的文件名,之后每次跑题都用同一份材料。不要每次换当天的新料,否则输出差异可能来自材料本身而不是模型表现,后面的横向对照就没有意义。

给每题写明输入、必须出现的信息和不接受的说法

三栏的作用是把“好不好”变成能逐条核对的条目。必现信息尽量写成可以直接搜索的关键词,例如负责人姓名、截止日期、统计口径、单位;不接受说法写成明确的禁止表述,例如不得新增原文没有的时间点、不得把“待确认”改写成“已确认”、不得用模糊措辞替代材料里的明确数字。

题号 / 任务输入必须出现的信息不接受的说法
01 会议记录摘要一份完整的会议原始记录负责人姓名、截止日期、“待确认”状态新增原文没有的时间点;把“待确认”写成“已确认”
02 周报整理本周零散进展条目若干每条进展的口径、下周计划、风险项把未完成项写成已完成;使用没有依据的形容
03 数据说明一份表格的口径说明与字段注释统计周期、计算口径、单位省略统计周期;混用不同单位

填写完之后,必现信息可以直接在输出文件里检索,例如放在同一个目录下执行:

grep -c "负责人" task-01-output.txt
grep -c "截止日期" task-01-output.txt
grep -n "待确认" task-01-output.txt

计数为 0 就说明这条必现信息没出现,需要结合输出上下文确认是漏写还是换了说法;命中关键词但语境不对,也按未通过处理。这一步是为了让核对有落点,不是让关键词替代你读一遍输出。

Longcat-2.5-preview 先固定自己的测试题 / 别急着看别人的评分

固定问法,一次一题,记录原始输出

问法一旦定下就不要再改。同一道题第二次跑时如果顺手把语气调顺了一点、把两条要求合并成一条,两次输出就没有可比性,结果差异说不清是题目变了还是模型变了。确实要改,就另起一版问法,旧记录照旧保留。

你是文本整理助手,请只基于我给出的原始材料输出。

任务:把下面的会议原始记录整理成要点摘要,不超过 300 字。
原始材料:
<粘贴 task-01-input.md 的全文>

硬性要求:
1. 保留材料中出现过的所有负责人姓名和截止日期;
2. 保留“待确认”这类状态词,不要改写;
3. 不要补充材料里没有的时间、数字或承诺;
4. 不要用模糊措辞替代材料中的明确说法。

输出格式:
- 结论:1 条
- 待办:每条一行,包含负责人、事项、截止日期
- 待确认:如有则列出,没有则写“无”

跑题时上下文、参数保持一致,粘贴的输入保持一致,一次只提交一道题。记录表建议包含四列:题号、问法原文、原始输出、日期。问法原文整段粘贴,不要只写“摘要题”;原始输出直接保存,不要先手工润色再存;日期写到天即可,用来区分跑了几轮。

用三档打分并各写一句理由

  • 通过:三栏里的必现信息全部出现,没有踩任何一条不接受说法,输出格式符合问法里的要求。
  • 部分通过:必现信息缺一条,或格式不合要求,但内容方向没有歪,也没有踩禁止表述。
  • 不通过:踩到任意一条不接受说法,或必现信息缺两条以上,或输出方向与原始材料明显不符。

理由句要落到具体条目,例如“部分通过:缺‘截止日期’这条必现信息,其余两条都在,没有新增原文没有的时间点”;再如“不通过:把原文的‘暂缓’写成了‘建议推进’,踩了不得改变结论方向这一条”。只写“感觉一般”,下一轮改题时就没有依据。

把自己的结果和公开评价对照,只比同类任务

对照时各说各的,再找交集。写法可以是这样:我这边的摘要题通过,必现信息里的负责人和日期都在,没有出现禁止表述;公开评价里被反复提到的长文档检索题不在我的题单内,所以那条评分不参与我对摘要题的判断。反过来,如果公开评价提到某类题容易漏编号,而你的题单里正好有编号类必现信息,那就回到记录表里核对一次自己的原始输出。

公开评分通常是在别人的材料、别人的问法下得到的,和你的三栏标准不是一回事,它更适合当作“要不要多做一次核对”的提示,不能直接替换你自己的通过结论。等题单跑过两三轮、记录表攒够几行之后再看结果,判断会比第一轮稳妥一些;这期间先把题目和问法固定住,比到处找新评分更有用。