如何评价近年来越来越多的本科生参与撰写人工智能领域的学术论文这一现象?
如何评价近年来越来越多的本科生参与撰写人工智能领域的学术论文这一现象? – 傅科摆的回答 – 知乎
https://www.zhihu.com/question/656916384/answer/2079749234182702729
利益相关:本科在读,大三刚结束。且在疯狂赶ICRA中(但我不是做 vla 的也不是CS本,我们这次做的工作也是偏Robotics的内容)
(这个回答范围仅限于Embodied AI领域的“AI”,如果你是LLM VLM 优化 AI4S 等领域的看看就好,因为不同领域对research的要求可能很不一样)
这个问题本身没有预设某种偏见或者想要对这个现象下一个价值判断是挺好的,因为这个问题你站在不同方面的视角下看就能得到不同的结论产生不同的态度。
首先从作为学生的角度看,学生也可以大致分为几类:
A:古法编程时代成长起来的人,目前大多处于硕博阶段,或多或少地也会带本科生科研。
B:一部分AI native或短暂地经历过古法时代的本科生(以高年级为主),已有CCF A会或Embodied AI领域顶刊已接收/发表/在投的独立一作论文。
C:一部分因为科研门槛降低且因保研/找实习/工作门槛提高,成果通胀而因焦虑想要参与科研 拿到成果的AI native学生(低年级为主)
如果你自己处于A/B的集合里,你可能会发现自己带的同学里 不会用git并且一直不肯练/不会装ubuntu/不会基本的bash命令/不会看日志不会看报错/不会自己从github上找需要的项目/不会配镜像源/不懂代理、VPN、NAT/没有基本的计网常识/不会用docker、k8s/不会恰当地使用AI/完全不知道如何检索和整理论文、提炼内容/完全没有自主发现问题或提出make sense的方法或实验tricks的能力/缺乏自主学习和探索能力/完全没有任何自主debug能力/不懂软件工程的基本规范/完全看不懂代码 的人开始变多了,而在过去,这样的同学很少在本科阶段就产生想要参与科研的想法并去加入课题组/实验室,但现在CS/Control/AI的本科生似乎人均科研经历/课题组打工经历的焦虑风气之下也开始push着C集合里很多明显并不适合在这个阶段开始科研的同学参与科研。
举一些例子的话:我自己目前在实验室带的这个赶ICRA的小组里 学生包括我在内一共有6个人,我们从7月初开始做这个project,一共经历了2个同学中途加入和2个同学quit,其中一个quit的同学是中途加入的。但我自己因为暑假同时在北京实习,周中只能每天用codex写代码同步到github仓库上,每天早上给实验室的大二同学发研究和实验任务然后晚上拉会同步进度,周末才能回学校自己调机器人做真机实验。
但我对每个人都有不同程度的观察和判断。
有三个同学甚至没法在3天之内完成我给他们布置的 在自己笔记本上装ubuntu、学会git基本操作(其实主要就status fetch pull add commit push log checkout branch diff 处理冲突 这些)、学会写markdown这些非常简单且基础的任务。他们里有一个人的ubuntu甚至是找人代装的,codex也是找实验室其他同学帮忙装的(我:???)
这些同学里有人在我反复提醒他4次要学会用markdown之后仍然每次都坚持在群里发word并且把word也发给AI甚至把word传到github项目仓库里。有人把ROS2编译产物/数据/模型也一起commit。有人推送了代码之后甚至不知道自己推送的是哪个分支。有人因为自己不会配代理不会改配置而终端pull代码因为一直走的直连很慢和我抱怨实验室网络不好,在我给出了详细的排查和解决网络问题的流程之后仍然不会操作。
其余几个同学基本功好很多,也让我省心很多,但我观察到参与这个项目的所有大二同学都有一些共同的问题:没有随手把开发/研究过程遇到的问题记录到一个/多个随时开着的文档里的习惯,同时对AI生成的回复缺乏自己的判断力,对每次AI改了哪些内容缺少掌控力,最关键最严重的问题是总是不知道自己想要实现/修改什么功能或参数要去哪里找哪个配置/哪个入口/哪些类和方法。
而综合所有因素加一起就导致经常出现他们有三个人一周产出的总和加起来不如我自己一下午产出的情况。
所以我开始好奇,在我和他们周末实验室线下相处的过程里我开始观察他们是怎么debug和思考的:
一个具体的debug例子:同学F在ubuntu22部署我自己在ubuntu24上部署过的,用Python写的服务,用tmux作交互 键盘输入 会话管理的数采模块时出现server反复退出的问题。我看了一眼终端里打印的日志发现topic都正常ready了,然后给了他5个排查顺序的建议:1.先看commit hash 看代码是否和我的对齐 2.看软件版本是否和我依赖文档里写的对齐,特别是tmux版本 3.排查是否有因为ubuntu和ROS2版本不一致导致的问题 4.检查是否有路径问题 5.所有全没问题了再考虑硬件问题
但他刚听完只记住了最后一句,然后反复插拔数采设备也没检查出哪有问题,半小时之后还没解决,来找我,我又给他重复了一遍,然后发现果然是tmux版本没对齐导致的问题。
然后我帮他复盘,问他的思考过程。他给我讲了一堆,我发现他在这个过程中的问题本质上其实是对进程 线程 ROS2通信机制掌握的不清晰,如果他具备一点常识就会知道如果某个CAN或者usb没插好表现只是那一个topic的窗口不会收到数据 报错,而不是整个服务进程崩溃。
但他为什么在自己理解不够清晰的情况下就敢于做出“硬件连接问题会影响服务进程”的判断呢?更本质的原因是缺乏足够的debug训练就会缺乏足够的“理性地思考”的能力,不知道什么时候该去做警惕不符合直觉的(只存在于他自己猜想中的)设计模式/逻辑/思考的模型,不知道什么时候需要获取进一步信息之后才能下判断,该大胆假设小心求证的时候反而又没法提出有意义的假设了。
缺乏足够的理性和经验,就会导致debug过程中的进和退都举步维艰,效率十分低下。而AI native的这群人又天然地缺少培养debug能力的优质环境。
(到目前为止,我们好像都 没提到 真正意义上狭义的research需要的 那些能力,一直在提engineering,但其实从engineering水平上已经能看出一部分人完全不适合做至少我们这个领域的research了)
(但狭义的research在这里也只能暂且不表,因为我现在也没法厚着脸皮说我很懂research并且能够对AI research对本科生产生的影响给一个结论)
我们继续jump to another perspective,课题组的老师/企业雇主/面试官视角:
其实PI视角和雇主视角也应该分开看,但我比较懒,就都放一起写了。
首先问题在于不管是LLM还是VLA还是VLM还是什么别的AI细分领域,问题在于做这些方向的老师很大一部分都是年轻新入职的PI,当新实验室的研究生数量还不够多的时候,自然就会想要找一些优秀的本科生来实习/干活,并且提前筛选/培养出自己的潜在研究生candidates,那么没有足够时间对每个学生进行细致考量的老师就会偏向于“给任务 试错 筛选”式的养蛊式粗放培养,这当然是有道理 无可厚非的 毕竟你不能要求老师对没有正式研究生师生关系的本科生以自己亲手带的硕博的培养方式去指导。
但我自己从非理性的角度来讲,我觉得这种方式很残酷的同时,也会让一部分确实不合适的同学感觉frustrated且进退两难,也给同组同学造成困难,既然这样那不如一开始就早早劝退他们。
而如果我是老师,我现在也会很绝望,主要原因是AI发展的实在太他吗快了导致我们过去几十年里积累的一切评价指标和方式一部分开始崩塌失效,而另一部分最致命的反而不是直接崩塌而是“悄悄地调转了方向”。
我们过去的1.0版本认为成绩/GPA最有含金量,是在实习/科研/竞赛等百花齐发的评价标准还没有大面积铺开的时候,那时候虽然评价体系相对单一,互联网也不像现在这么发达,虽然很多适合科研,脑子好使的人被捞进了这个筛选体系的受益者群体里,依然导致一部分其实只适合做题,并不适合research的人稀里糊涂地走上科研之路,然后崩溃地发不出论文/延毕/甚至为了毕业开始学术造假,最终除了一个学位之外啥也没剩下,找了一个专业知识不强相关的工作躺平,一辈子痛恨科研和自己的科研经历。他们很多人也都成为失语的时代眼泪了,但从目前的世俗意义来看也过得都不错,只是没有达到他们自己曾经心中的预期而已。
2.0版本开始以后,多元化这个词开始提上日程,逐渐在这个过程中有了可能做题不那么强,但综合能力更强,在短期内就能受到多方面历练和培养的学生进入到受益者群体行列里。但人们逐渐发现了竞赛/论文/科研其实相比于考试实打实考出来的成绩,有太多可以操作的空间了,于是这个阶段里也出现了很多不学无术但会包装和经营,会到处蹭比赛蹭成果的人也拿到了不错的名校offer成为了2.0体系下的受益者。
而到了目前这个他吗疯狂的3.0时代,如果你是那种看重课业成绩的old fashion老师,你会绝望地发现我们的的大学里(只限定在CS/EE/AI/Control/Robotics这几个类型的专业 因为其他的我不懂)教的东西几乎全部是死板过时八股的,不仅不触及问题本质,没法让学生把一个工程问题背后的数理原理打通的同时,出题标准也不鼓励学生进行几何/数学/物理意义上的深入思考和挖掘,而是考背题型套公式刷泄露出来的往年真题,而我们关于编程/软件工程的教育又是在别的回答里被无数次吐槽过了,这里就不写了。同时,开始逐渐缩小的区分度逼着学生们开始去尽量选能拿高分的水课,并且在水课/手抄实验报告/AI写的课程论文/无意义的背诵考试/每一次小作业上竭尽全力地去卷出高分,那么请问,这个3.0体系下筛选出的大部分获利者,是我们目前需要的researcher和engineer,还是把大学当第二次高中上的做题家呢?
(当然不可否认,每个专业每个学院都会有一些少数课业和科研/竞赛都能平衡得很好的非常优秀的人的,我自己也认识不少这样的同学。但我依然反对造神运动和强行想让所有人都向他们看齐的风气。)
好了,那么如果你是看重AI native ,看重真实科研能力和工程能力的老师,你又要面对不知道如何以一个稳定 客观 有效的方式去考量他们的问题,因为长久以来你形成的关于“好的研究者/工程师”的标准正在被AI悄悄扭转方向,比如我们过去用C++/python这样的语言去写代码,而我们现在大部分人每天用的更多的恐怕是自然语言编程。那么自然语言和高级语言虽然本质上只是抽象层级的改变,但是这就造成了原先一部分由于思维/工作记忆/注意力等等短板而在算法题上表现没有另一部分人好的a类同学现在在“自然语言编程”这个事情上表现出的结果反而可能会比一部分原先更擅长高级语言的b类同学追平甚至好一些。那么只从结果来看的话,你想,是不同的版本果然会筛选不同类的人,但是你又会隐隐约约地觉得a类同学“不够扎实”,同时b类同学也会隐隐约约觉得自己原先的大优势现在被版本更新搞得没那么强势了。
当然,如果从整个年龄段来看,我上面这段里提到的a类和b类同学可能都是同年龄段里的前1%甚至前0.5%,但也正因为如此,这部分前1%的同学之间的竞争烈度、对版本更新导致微小优势变化的敏感程度反而是最高的。
我上面举的这个例子可能不算非常贴切甚至逻辑上都不算很严谨,但你们应该能get到我想要表达的是什么:比起不太可能真正发生的突然的大洗牌而言,正在真正发生的是结果侧的 悄悄的 逐渐变化的优势转向和慢慢的洗牌 才会让很多人真正感觉绝望和无所适从。
而作为面试官而言,很多公司的很多岗位也已经不再考算法八股而是提更加开放性的问题,考设计思路,解决问题的思路、限时给一个完全开放的vibe coding问题看完成度、通过面试者讲过往项目经历的细节来看其技术、思考的扎实程度、灵活性。而论文的含金量 权重毫无疑问地会被降得越来越低,而在就业侧和升学侧,单纯靠简历和量化指标来筛选一个人也会变得越来越不可靠,我们未来能够看到越来越多的 两个人的经历、条件、成果都相差无几,但是实际能力或者说和真实工程/算法/学术研究需求的匹配度天差地别的实例,那么筛选标准就会不可避免地走向灵活和主观,而灵活和主观又会不可避免地带来公平性问题和质疑。
最终我们期望这会是一个螺旋上升的过程,我们期望人的处境越来越好,但至少目前可见的却仅仅是一个大家都逐渐被困进焦虑漩涡里的死局。
