科研
从原始数据到出版级图表与成稿报告,全程带领域纠错闸门。
能做什么
- 出版级图表:200dpi、色盲安全色板、坐标轴单位齐全,每图带 caption
- 文献综述:按主题整理成对比矩阵,标注每篇的方法、样本量与结论
- 领域纠错闸门:执行前后各跑一遍,专拦「能跑但科学上错」的代码
- 大文件分析:超大 CSV / 日志分块处理,不爆内存
- 从分析脚本到成稿报告一条龙,每个结论可溯源到数据
试试这样做
- 这是我的实验数据,帮我做完整分析:每张图出版级质量、色盲安全配色,最后写一份带方法说明的分析报告
- 围绕「气候变化对水稻产量的影响」做一轮文献综述,整理成对比矩阵,标注每篇的方法、样本量和主要结论
- 检查这份分析脚本有没有「能跑但科学上错」的问题:量纲、坐标系、多重比较校正都过一遍
包含技能
- domain-check — 编写或运行科学分析代码(物理/地学/生物/化学/社科)时使用——执行前跑一次抓错,出结果后再跑一次做最终闸门。运行确定性领域纠错检查,捕获"能跑但科学上错"的代码(量纲不一致、对经纬度做欧氏距离、0/1-based 坐标与链向错误、SMILES 化合价不可能、多重比较未校正、对类别编码求均值)。只报结构化 findings,从不宣称代码正确。
- large-file — 读取任何可能很大的数据文件前使用(CSV/TSV、Parquet、HDF5、FITS、NetCDF、NDJSON、基因组 FASTQ/FASTA/VCF/BAM、GRIB、ROOT,或大文本/仿真日志如 VASP OUTCAR)。以内省+采样在有界内存内返回紧凑内存指针——表头/schema/形状/样本/关键数字——从不把大于上下文窗口的文件整体载入模型。按指针引用数据,只确定性地读取需要的切片。
- figure-spec — 用 matplotlib/seaborn 生成任何图表、绘图、可视化时使用。应用统一的出版级图表规范:rcParams、PNG@200dpi、坐标轴单位必标、色盲安全色板(Okabe–Ito)、每图 caption 写进报告。
- literature-review — 查找、核验、综合科学文献时使用——从"X 领域的奠基论文是哪篇"到完整的多来源综述。覆盖:先检索后动笔的取证纪律、杜绝编造引文、撤稿排查、把结论的确信度校准到证据强度。
- pipeline-data-analysis — 用户要求"跑一遍数据分析闭环",或提出任何从数据文件到最终报告的完整分析诉求(分析这份数据并出报告 / 出图+结论 / 端到端分析)时使用。按五步协议编排:摸底→分析→出图→报告→审计,每步有产物验收,不过不进下一步。
自研 · 可自由商用