昨天我让 AI 帮忙起草一篇光纤传感论文的 Introduction,并且跟它交代了实验结果还有参考文献都在附件里面。
它交回来的东西倒是让我愣了好几秒。一份按照六个修辞动作排布好的骨架,每一节顶部都标明了这节应该开展什么工作、哪里存在拒稿风险点,凡是要填入数据的地方统统标着【待填】,一条文献也没编,一个数字也没瞎猜。开头一行写得极其直白,附件并没有落到它能够读取到的路径,所以事实性内容就全部空缺了。
我的第一反应是这东西可真笨。不过第二反应是,笨得完全对。
AI 撰写学术内容最容易引发的事故就是编造引用。我身边就有同事吃过这个亏,选用 AI 帮着写综述,生成的参考文献看着像模像样,期刊名还有卷号全都齐备,去查的时候却发现根本没那篇文章,导师审稿时逮个正着。学术界已经出过好几回 AI 编造参考文献从而导致论文被撤的事情了。一个科研工具要是连这条底线都守不住,用起来简直就是给自己埋雷。
那个项目名叫 aiset-academic-skills,三个 skill 打包在一起,MIT 开源。我把它装到本机跑了一遍,顺便把 README 逐条进行核对。
三个包各管一摊
research-writing-skill 负责论文正文。摘要、引言、相关工作、方法、实验、讨论、结论都能写,并且还能润色以及起草审稿意见回复。
office-academic-skill 负责处理 Word 和 PPT。把 PDF 论文转成中文文献阅读报告,做组会 PPT,开题、中期、答辩 PPT,输出的都是能够直接编辑的 .docx 和 .pptx,同时还能匹配学校模板、克隆母版。
scientific-toolkit-skill 负责科研计算。MATLAB 和 Python 两条线,信号处理、统计、机器学习、仿真、论文配图导出这些全包。
它们串的是一条线
README 里面举了个例子,我照着理解了一下。你手上要是有一批实验数据,先让 scientific-toolkit-skill 做统计分析和论文配图,再让 research-writing-skill 撰写实验与分析那一章,最后让 office-academic-skill 把成果做成组会汇报 PPT。
这个联动设计算是整个项目最为聪明的地方。科研人的真实流程本来就是这样的,数据算完得写论文,论文写完得做 PPT,中间全凭手工搬运,图要重新导一遍,结论要重新敲一遍,格式要重新对一遍。现在有人把这条线给打通了,省下来的就是搬运那部分力气。
装完不用敲命令,凭借对话内容自动触发。你要是说帮我写论文引言,写作那个就起来了。你要是说把这篇论文整理成 Word 阅读报告,Office 那个就接上了。你要是说借助 MATLAB 做 FFT,计算那个就来了。当然也可以显式点名要用哪个。
我为什么盯着「不编造」这条看
三个 skill 都写死了同一条规则。坚决不虚构 DOI、作者、期刊信息,也不编造实验值、图表编号、页码和结论。定量结果必须附上来源标签,推断性内容则要显式进行标注。
research-writing-skill 额外多做了一步,将信息划分成了四个类别。原文或已有数据、用户确认内容、根据上下文推断、建议性扩展。这四类分开进行标注,这样一来你一眼就能看出哪句是它抄的、哪句是它猜的。这个设计比单纯承诺不编造要有用得多,由于承诺谁都会写,分栏标注却是能够进行核验的。
它还明令禁止了几个词汇。「显著」「先进」「有效」「鲁棒」,要求替换成可测量的条件以及对比基准。写过论文的人都知道这几个词往往是审稿人的靶子,能被写进规则里,说明做这套规则的人挨过审。
昨天那份骨架就是凭借这条规则运行出来的结果。材料不在手上的时候,它宁可交一份空架子,也不给我编造一组看起来像真的一样的灵敏度数据。
中文优先,分寸在哪
三个 skill 都着重强调中文优先,解释、正文撰写、幻灯片默认运用中文,但论文标题、公式、变量名、模型名予以保留英文,软件命令和参考文献同样不进行翻译。
这个分寸把握得挺务实。国内科研人写东西本来就中英混着来,你不可能将公式里的变量名翻成汉字,也不可能在 PPT 里把 MATLAB 命令写成中文。我之前选用过一些号称中文科研工具的东西,要么整界面英文化,用着别扭,要么强行中文化,将专业术语翻得面目全非。
做这个的人应该在实验室待过
scientific-toolkit-skill 我多看了两眼,它关注的领域挺具体。光学、光电子、光通信、光纤传感,连 BOTDR、BOTDA、BGS、SPM 这些缩写都单列出来了,色散、噪声、去卷积也包含在里面。
Python 那边覆盖面很广。NumPy、SciPy、pandas 是基础,scikit-learn 负责机器学习,statsmodels 负责统计建模,SymPy 负责符号推导,pymoo 负责多目标优化,simpy 负责离散事件仿真,QuTiP 负责量子光学和开放量子系统,pymatgen 负责材料计算里的晶体结构、能带和态密度,Astropy 负责天文和光学成像数据。我数了下子模块目录,21 个。
文献那块接了 arXiv、PubMed、CrossRef、Semantic Scholar、OpenAlex,DOI 转 BibTeX 也做了,并且还有引文元数据提取以及引文验证。
列库名谁都会,列到 QuTiP 和 pymatgen 这一层,还顺手将光纤传感的缩写全写上,这就不是拍脑袋凑的了。
PPT 那几条规则,看着不起眼
office-academic-skill 里有一份幻灯片质量规则。每页一个核心观点。标题选用行动标题,也就是将结论写上去,而不是贴一个话题标签。图表和公式承载技术论证,避免大段文字。坐标轴、单位、图例、公式、数据来源保持科学准确。背景运用白色或克制的学术风格,借助颜色引导注意力。还专门列了要避免的毛病,文字溢出、图片拉伸、中文乱码、缺字体、旧模板文字没清干净、元素重叠。
这些规则单看都不怎么起眼,你要是随便翻看几个国内组会 PPT 就能知道违反的情况有多普遍。满屏幕全是文字,标题写着「实验结果」却不是结论,图表连坐标轴标签都没有,配色更是跟彩虹似的。
我读研那会儿组会 PPT 被导师打回来七八次算是常态,每次打回的原因都差不多,标题太泛,数据图没标单位,颜色太花。那时候要是能有这么一份规则卡着,至少能少挨几顿骂。
装进 AISet 以后多出来的东西
AISet 客户端下载地址是 aiqianji.com/download。装好以后在聊天界面点「专家技能」,输入一句话就行,请帮我安装 https://github.com/icodebase-cn/aiset-academic-skills.git 。三个包就会一起进来。
不用 GitHub 也没事,把 README 丢给 AI 让它读一遍,让它照着装也能成。
单纯装上,你得到的是三个技能包。装进 AISet,多出来的则是另外两样。
一样是 Memory。技能包写的是通用的科研规矩,Memory 记的则是你自己的规矩。你投哪个刊,学校模板长什么样,导师讨厌哪种表述,公式符号习惯选用哪一套,改稿时你总是把哪类句子删掉。把这些东西记进去以后每轮对话会自动注入,不用每次都重新交代一遍背景。
另一样是知识库。你自己消化过的文献笔记、写过的那几篇代表作、攒下来的方法论,放进去以后 AI 就拿它们当参照。技能包告诉它论文该怎么写,知识库则告诉它你写出来是什么样。
用久了差别就看出来了。同一个技能包,装在不同人的机器上,产出的东西应该会越来越不像。
有一点得提醒,知识库可不是把五百篇 PDF 全堆进去就完事了。没消化过的东西放进去只会添乱,AI 检索到一堆你自己都没读懂的段落,写出来的东西更飘。放你读过、划过线、有过判断的那些进去才行。
要是你眼下正在读研又或者从事科研工作,每天都在论文、PPT 还有数据分析这三大块事情之间来回折腾的话,倒是可以尝试着用一下。刚开始起步的时候没必要把三个一块儿全给装上,直接挑那个让你觉得最头疼的环节就行。要是老是被 PPT 给折磨,那就先动手把 office-academic-skill 给装上,借助它把你下一篇论文的阅读报告给生成出来,瞧瞧到底合不合你自己的口味。
