利益相关声明:作者与文中产品有直接的利益相关(开发者、自家产品等)

写在前面

关于这篇文章,有三件事需要先说清楚:

利益相关。 文中介绍的 AXIA 是我自己做的产品,目前还在内测。我没拿任何第三方的钱,也没收过什么实物支持。

AI 使用。 写的时候用了 Claude 来整理素材、顺段落结构。但所有观点、经历、判断和数据都来自我本人和生产数据库;每处事实我都对着原始记录逐条核过,也查过没有跟别人雷同的地方。

内容边界。 这篇分享的是我做工具的过程和观察,不构成升学、择校、择导的建议。里头提到的评分和信号,都是用公开数据算出来的,只能帮你缩小范围,不能替代你自己去核实,更不能替代你跟导师或在读学生直接聊。做决定之前,请一定自己再查一遍,也找学校老师、辅导员或招生办问清楚。

一、找导师这件事,难的不是「查不到」

我今年六月从北大博士毕业,之后开始做自媒体。这几个月后台私信里最多的一类,翻来覆去就是同一个问题:某某老师怎么样?卷不卷?

想躺平的,想冲的,想多发论文的——大家诉求各不相同,但卡住的点一样:没有靠谱的信息。

我当年自己找导师,流程大概是这样的。先打开学院官网的师资页,看到一份不知道多少年没更新过的名单;点进某位老师的个人主页,最新一条通知还停在 2021 年的招生信息;再去社交平台搜名字,翻到两条互相矛盾的匿名帖;最后在认识的人里一圈圈打听,看能不能找到一个说得上话的学长学姐。折腾了一圈,凭一句「听说人还行」,做了个影响三五年走向的决定。

问题其实不在于查不到。公开信息并不少:论文库里能看到他近五年发了什么、跟谁合作;院系页上有职称和邮箱;个人主页上偶尔真的写着今年招几个博士。问题是这些东西散得到处都是,新旧混在一起,而且没法验证——你明明看到过「他今年招人」,三天后死活想不起来在哪儿见的了。

高校课题组恰恰是导学错配率很高的地方。所以你常会听到人说「我觉得自己挺幸运的,能进某某老师的组」——把一件本该可以判断的事,说成了运气。

我想做的不是「帮你推荐最好的导师」,没人有资格算这个分。我想做的是另一件事:把判断依据摊开摆在一起,每一条都能点开,看到它来自哪个网页、哪天查的、有多确定。这就是 AXIA。

截至2026年9月初,库里有7265位导师、20,995篇已收录论文、9,305份存档下来的原始网页,覆盖67所院校。最后这个数字值得多说一句:它不是我圈定的收录名单,而是有人检索过就会自动增加——你查了一所我没有覆盖过的学校,系统当场建档、算分、存证据,下一个查到他的人直接就能看到。

二、第一条规矩:每一句话都要能点回去

这是整个产品里我觉得唯一值得单独画张图来说的东西。

图 1. 导师匹配流程示意

有三个环节想展开讲。

你明说的条件是硬要求。 输入「985 高校里做社会保障方向的博士生导师」,学校层次和研究方向都会变成必要条件,而不是打分时的一个加权项。这听着像废话,但我在运行日志里抓到过好几次相反的情况:模型判断「这个人虽然不在 985,但方向特别对口」,于是把他放了进来。用户不会觉得这是贴心,只会觉得这产品没听懂人话。

抽取必须带原文引用。 模型从网页里读出一个联系邮箱时,要同时交代它是从哪一句话里读到的。这句话如果在原始网页里检索不到,哪怕只差一个字,整条抽取直接作废,不写入数据库。这条规则挡掉的不仅是模型凭空编造,还有那种更隐蔽的错误——模型把隔壁老师的邮箱安到了这位头上。原文对不上,就说明它读串了。

查过的结果分五种情况,不是简单的“有”和“没有”。 「查过了,确实没有公开邮箱」和「还没查过」是完全不同的两码事,界面上必须分开:前者你可以放心去找别的联系方式,后者只说明我们还没干这活。这两种情况早期被我合并成同一个空值,结果用户看到一片空白,不知道该不该信。

抓回来的原始网页全部存档。 三个月后再看同一张卡片,它还是能指回当时那一页。

三、8 个信号分开看,不折成一个总分

第二张图是评分体系。分两层:上面一层是导师本身的档案信号,谁看都一样;下面一层是你跟这位导师的匹配,换个人来问就会变。

图 2. 导师量化评估维度

给个总分排个名,当然最好卖。我没做,理由很具体。

「带学生的迹象」这一项本质上是推算出来的,来自合作发表关系——跟学生共同署名的模式。这是一条值得再核实的线索,不是对这位老师的评价。把一个推算值和「近五年发了多少篇论文」这种硬事实揉进同一个总分,等于把不确定性洗掉了。所以界面上它被明确标成推算,颜色都跟别的项不一样。

某一项没有公开数据时,正确的做法是写「公开信息有限」,再把剩下几项的权重重新归一,而不是给这一项判零分。判零分会让「信息少」看起来像「能力差」,两码事。

数据可信度这一项单独显示,永远不并入分数。一位只有 3 篇论文可查的老师,他的活跃度分数天然不可靠;这件事应该用一个独立的标签告诉你,而不是偷偷把他的分调低。

还有一批东西是我刻意没做的:人品、脾气、push 不 push、好不好毕业。这些在公开数据里根本没有,涉及这些词的提问会被直接拦住,不会拿去联网「研究」。想问这些,产品里有另一条路——「问学长」,付费问在读的人,双方匿名,钱由平台代管。

四、做这件事时,被现实纠正过的四个判断

这一节大概是最有普遍价值的部分。做之前我有一堆想当然的假设,下面四条都被数据打了脸,而且它们的教训不限于择导这个场景。

学术圈那个「唯一身份号」,我抽查 125 条,40 条挂错了人

学术圈有套研究者身份系统叫 ORCID,给每位研究者一个唯一编号。理论上有了它就不会再认错人。

我做了一次全库体检:抽查 125 条带编号的记录,有 40 条绑定是错的,占 32%。同济大学一位做城市规划的教授,档案上挂着中国农业科学院基因组研究所某人的编号;他的另一份官网档案则挂着一家肿瘤医院的编号。这些编号不是凭空冒出来的,是上游数据库按姓名做模糊匹配挂上去的。

更麻烦的是错误会自我加固。系统拿着错误编号去拉履历,把编号主人的任职经历灌进这位老师的档案,下一轮再校验时,这段被污染的履历反过来给错误编号作了证。我的体检脚本第一版就栽在这里,把两个明显挂错的编号都判成了「已核实」。

后来的做法是:编号只有回验通过之后才有效力,未核验的一律零效力,既不加身份分,也不允许拿去拉履历;而回验的时候,必须把「由这个编号本身带进来的证据」排除在外。

普遍一点的教训是:一个字段看起来是权威唯一标识,不代表你手里这一份是对的。该问的不是「这个标识可不可靠」,而是「我这一份是怎么来的」。

同一个人被拆成 5 条档案,而「合并」是最危险的操作

麻省理工学院一位很有名的教授,在结果页里出现了 5 次——他同时挂靠多个机构,上游数据库把他拆成了 5 个作者编号。

顺手合并不就行了?不行。同名合并是这类产品里最危险的操作。中文姓名的拼音重名极其常见,把两个真人合并成一条档案,比拆成两条糟糕得多:错误会永久地混进他们各自的履历,而且极难被发现。

最后的做法是写了一串「拒绝合并」的判据,而不是「允许合并」的判据:同一个个人主页则必合并;各有主页且不同则拒绝;机构口径不一致则拒绝;没有中文名、只靠拼音相同则拒绝;研究领域双向零重合则拒绝。默认拒绝,逐条放行。

97% 的「任职单位」,其实只是论文署名

有用户报了个问题:同一张卡片上,一位老师的单位出现了三个说法——卡片写 A 校,官网挂靠写 B 校,详情页写 C 校。

追下去发现根子在一条我一直默认成立的等式:论文署名机构等于任职单位。它不成立。署名只能说明这个单位出现在他的某篇论文上,合作、访问、共建、挂名都会出现。我的开发库里有 3048 条任职记录,其中 2979 条(97%)其实只是论文署名的聚合。

修法不是把它删掉——用它来召回是有效的,它至少能提示「这个人可能属于这所学校,值得去查」——而是给证据分级:来自院系官网、个人主页的算「官方」,来自论文署名聚合的算「推断」,界面上只允许前者用于断言。

「慢」的原因不是检索,是模型在思考

有用户反馈:点名查一位库里早就有的老师,还要等两分钟。

我的第一反应是检索链路太重。翻生产库里的运行记录才发现,本地检索只占 2 到 4 秒,没有联网,没有刷新。两分多钟里,规划阶段占 12 到 35 秒,生成回答占 110 秒左右。

再看 token 数据:回答正文只有一千八百多字,输出 token 却有一万四到一万六千。差额全是看不见的推理 token——我用的模型默认开启高强度思考模式,而我的代码里从来没传过关闭它的参数。同一条提示词实测:开启思考 40.1 秒,关闭思考 4.9 秒,正文长度差不多。

规划、抽取、摘要这类结构化任务根本不需要「深思」。

五、一条完整的动线

AXIA 不是一个搜索框,是申请季那几个月要反复做的事的集合。实际用起来大概是这样:

  1. 我的画像——传一份 PDF 简历,方向、项目、发表自动读出来。只填一次,后面全部接着用。
  2. 帮我匹配——用大白话说要求。库里有的立刻出结果(这部分永远免费);凑不够人,才当场上网去找。每位候选都写清哪里对得上、哪里对不上。
  3. 导师详情——8 个评估信号、论文趋势、合作网络、活动记录、证据列表。每个字段点开就是出处。
  4. 对比——2 到 4 位放在一张矩阵里,比的是"各自适合什么场景"和"各自的风险",不评"谁更好"。
  5. 文书工坊——套磁信、个人陈述、研究计划、复试自我介绍。它比通用 AI 多的是两样东西:你画像里的真实项目和数字、这位导师近几年真正发表过的论文。所以出来的是"您 2026 年那篇用图结构处理冷启动的工作,我在您公开的代码上跑过一版预实验",而不是"贵校历史悠久,我仰慕已久"。
  6. 申请看板——十几个目标按冲 / 稳 / 保分层,截止日倒计时、材料清单、进展状态一屏看完。
  7. 问学长——公开资料查不到的那部分,付费问在读的人。(如果你读到这里,同时是在校生或者已经毕业两年内的学长学姐,欢迎你注册成为学长身份,帮助学弟学妹答疑,了解课题组)
  8. 项目资讯——订阅一个方向 + 最多三个地区,每天自动抓海外博士项目、奖学金和截止日。

图 3. 导师详情卡

图 4. 文书工坊示意

图 5. 申请看板示意

图 6. 问学长界面

图 7. 项目雷达

当然,上述动线是围绕基础功能设置的。如果要问我自己最喜欢哪个功能模块,我会选择“竞争力参考”

图8. 竞争力参考

这里会根据用户提供的画像,显示每位点开某位导师详情页的用户的背景,帮你更好地回答“这位老师的竞争激不激烈?”“我大概会处于什么水平”。你可以在这个模块中清晰地看到同样浏览关注这位导师的同学的发表经历、英语水平、学校层次和成绩等分布,进而更好地帮助用户进行导师选择的决策:是冲刺?还是保底?

六、它现在还不够好的地方

覆盖面还很小。导师主要集中在城市、气候、交通、建筑、环境、公共健康这几个方向,因为最初的种子数据是按这些主题导入的。查一个冷门方向很可能库里没有,要走联网现找,得等几十秒到一分多钟。

上游数据本身有噪声,我只能标注,不能修好。机构字段出错的比例不低,同名合并、档案分裂这类问题会长期存在。我能做的是把可疑之处印在界面上——比如某位老师的档案挂着 34 个不同机构、其中 14 个近三年仍有记录,卡片上会直接写明疑似多人档案被合并,请核对后再取用。

产品目前仍在凭码内测,每天限量放号。

最后,导师本人可以要求下线。每个公开页面底部有一个无需注册的入口,提交后该页立即下线并停止收录,我会在 3 个工作日内复核回复。

七、怎么试

站点是 AXIA。不登录也可以按高校、按方向浏览已收录的导师名单,以及几篇申请指南。想完整试用需要内测码,在首页的候补名单里留一个邮箱即可,每天放号。

我把 AXIA 的本质理解成搬运信息差。不知道怎么评估一位导师是否适合自己、不知道有哪些检索途径的,适合用「帮我匹配」;想了解更定制化的、公开资料上没有的信息的,适合用「问学长」;想申请海外博士、苦于岗位信息散落在各个院校各个课题组的,适合用「项目资讯」。

择导这件事,道听途说的代价太大了。我做不到帮你选对,但至少可以让你知道,每一条你据以做决定的信息,究竟是从哪儿来的。

有任何问题和建议都欢迎反馈,我希望它能变得更实用一些。