csvkit
wireservice/csvkit ↗计时单位:对一个 55 万行的 CSV 跑一次 csvstat(端到端)
$ python csvkit/utilities/csvstat.py big.csv逐位一致:每一项统计值都与原版 csvkit 相同
优化后的代码与补丁autooptm/csvkit-ao实测结果
我们用 AutoOptm 跑了这些公开的 PyTorch / Python 仓库,流程和处理任何用户提交完全一样:运行项目自己的命令(纯库项目没有入口命令,就用一段调用其公开 API 的基准脚本),端到端计时,并逐项比对优化前后的输出。
计时单位:对一个 55 万行的 CSV 跑一次 csvstat(端到端)
$ python csvkit/utilities/csvstat.py big.csv逐位一致:每一项统计值都与原版 csvkit 相同
优化后的代码与补丁autooptm/csvkit-ao计时单位:一张随机图跑完六项分析(介数中心性、PageRank、聚类系数等)
纯库项目,没有入口命令:计时的是一段调用其公开 API 的基准脚本。
$ python ao_bench.py10 张校验图上每个输出字段完全一致
优化后的代码与补丁autooptm/networkx-ao计时单位:一张 McMaster 图片:读取 → 加噪 → SwinIR-M 彩色去噪 → 写出 PNG → 计算 PSNR/SSIM
$ python main_test_swinir.py --task color_dn --noise 15 --model_path model_zoo/swinir/005_colorDN_DFWB_s128w8_SwinIR-M_noise15.pth --folder_gt testsets/McMaster每张输出 PNG 与原版相差不超过 2 个灰度级;对真值的 PSNR 变化不超过 0.01 dB
优化后的代码与补丁autooptm/SwinIR-ao计时单位:一周气候数据的汇总链(coarsen → rolling → groupby_bins → 距平 → 日最大值 → 写 NetCDF)
纯库项目,没有入口命令:计时的是一段调用其公开 API 的基准脚本。
$ python ao_bench.py统计量与原链路的绝对误差在 1.1e-5 以内
优化后的代码与补丁autooptm/xarray-ao计时单位:32 张图片一批,经 ViT-B/32 零样本分类(解码 → 预处理 → 图像塔 → 类别概率)
$ python main_4cf6e0.py零样本准确率 301/1034,与原版完全相同
优化后的代码与补丁autooptm/CLIP-ao计时单位:一张测试图:JPEG 解码 → 变换 → 生成器 → 写出 PNG
$ python test.py --dataroot datasets/horse2zebra/testA --name horse2zebra_pretrained --model test --no_dropout最差像素相差 2 个 uint8 级(PSNR 64.9 dB),小于原程序两次运行之间的差异
优化后的代码与补丁autooptm/pytorch-CycleGAN-and-pix2pix-ao计时单位:生成一个样本(200 个 token,pythia-410m,bf16)
$ python litgpt/__main__.py generate checkpoints/EleutherAI/pythia-410m --max_new_tokens 200 --num_samples 8逐位一致:与冻结的 bf16 参考输出最大绝对误差为 0
优化后的代码与补丁autooptm/litgpt-ao计时单位:64 段 ESC-50 音频一批,经 CLAP 零样本分类(音频 → log-mel → 音频塔 → 类别分数)
$ python -m open_clip_train.main --model CLAP-HTSAT-tiny-Roberta-base-fused --pretrained laion --audio-zeroshot-dataset ashraq/esc50 …ESC-50 零样本 top-1 87.85% / top-5 98.85%,与原版完全相同
优化后的代码与补丁autooptm/open_clip-ao计时单位:一批时间序列的拟合与预测
纯库项目,没有入口命令:计时的是一段调用其公开 API 的基准脚本。
$ python ao_bench.py预测结果逐位一致
优化后的代码与补丁autooptm/statsforecast-ao计时单位:DINOv2 ViT-L/14 对一批 16×3×518×518 输入做一次前向推理(随机权重,由仓库自带 hubconf 构建)
$ python bench_dino.py输出特征与原版 fp32 程序相比余弦相似度 0.99998、相对 L2 误差 0.0065
优化后的代码与补丁autooptm/dinov2-ao计时单位:REDS 视频片段中的一段 100 帧:读入帧、BasicVSR++ 4 倍视频超分、写出 100 张 PNG
$ python inference/inference_basicvsrpp.py输出的 PNG 与原版程序相比,99.9% 的像素相差不超过 1 个灰阶(PSNR 61.9 dB)。
优化后的代码与补丁autooptm/BasicSR-ao计时单位:端到端合成一句话(音素化 → Tacotron2-DDC → 声码器 → 波形)
$ python TTS/bin/synthesize.py --text "The quick brown fox jumps over the lazy dog, again and again." --model_name tts_models/en/ljspeech/tacotron2-DDC --out_path out.wav --use_cuda波形逐位一致(PSNR 124 dB)
优化后的代码与补丁autooptm/coqui-ai-TTS-ao计时单位:一条提示词:1.7B 门控注意力 Qwen3 检查点贪心生成 96 个新 token(批大小 1)
$ python demo.py --generate --prompts prompts.txt下一个 token 的概率与原版 fp32 程序相差不超过 0.0078(相对 L2 0.0028)
优化后的代码与补丁autooptm/gated_attention-ao计时单位:一帧画面(8 帧真实场景演示图,每批 4 帧):人物裁剪 → Sapiens 0.3B 308 关键点姿态估计 → 写出关键点结果
$ python lite/demo/vis_pose.py sapiens_0.3b_goliath_best_goliath_AP_573_torchscript.pt2 --input <frames> --output-root <out> …姿态热图与原版 fp32 模型的最大偏差 0.011(PSNR 82.8 dB),在未参与优化的批大小上偏差不超过 0.014。
优化后的代码与补丁autooptm/sapiens-ao计时单位:用 Wan 2.1 VAE 编码一段 33 帧视频(diffusers)
$ python wan21_encode.pylatent 与 fp32 编码结果的 PSNR 为 73.6 dB
优化后的代码与补丁autooptm/ao-vae-bench-ao计时单位:按官方参考配方的 batch 跑一步 ResNet-50 训练
$ python train.py --model resnet50与冻结的原版参考输出比对通过,含一组优化时未见过的数据
优化后的代码与补丁autooptm/vision-ao计时单位:Tanks&Temples train 场景上的一次训练迭代(渲染 → loss → 反向 → 稠密化 → 优化器更新)
$ python train.py -s tandt_db/tandt/train -m output/train --iterations 7000每次迭代的 loss 与原版相对误差在 2.5e-6 以内
优化后的代码与补丁autooptm/gaussian-splatting-ao计时单位:按配置的 batch 在 Kinetics-400 上跑一次 TSN R50 训练迭代
$ python tools/train.py configs/recognition/tsn/tsn_imagenet-pretrained-r50_8xb32-1x1x3-100e_kinetics400-rgb.py与冻结的原版参考输出比对通过,含一组优化时未见过的数据
优化后的代码与补丁autooptm/mmaction2-ao计时单位:一帧演示图:人物检测 → Sapiens2-1B 308 关键点姿态估计 → 写出骨架叠加图
$ python tools/vis/vis_pose.py <detector> configs/keypoints308/…/sapiens2_1b_keypoints308_shutterstock_goliath_3po-1024x768.py <pose.safetensors> …姿态热图与原版 fp32 模型的最大偏差 0.045(PSNR 85.0 dB),未参与优化的帧上不超过 0.033;100 帧全部写出。
优化后的代码与补丁autooptm/sapiens2-ao计时单位:一张输入图:解码 → 4 倍 RRDBNet(fp16)→ 后处理 → 编码写盘
$ python inference_realesrgan.py -n RealESRGAN_x4plus -i inputs与原输出相比 PSNR 59.8 dB,误差不到一个 8 位码值
优化后的代码与补丁autooptm/Real-ESRGAN-ao计时单位:PV-RCNN 演示程序处理一帧 KITTI 激光雷达点云:读取、体素化、检测
$ python demo.py --cfg_file cfgs/kitti_models/pv_rcnn.yaml --ckpt pv_rcnn_8369.pth --data_path ${POINT_CLOUD_DATA}检测结果与原版程序相差不超过 6e-4,比模型 0.1 的置信度阈值小 170 倍,在未参与优化的留出点云上同样成立。
优化后的代码与补丁autooptm/OpenPCDet-ao计时单位:一张图片走完 PP-OCRv6 medium:解码 → 文本检测 → 文本识别 → CTC 解码
$ python run_ocr.py留出图片上的文字与文本框与原版完全一致;最敏感的测试页相差一两个字符(相对 L2 0.054)
优化后的代码与补丁autooptm/PaddleOCR-ao计时单位:一个图像序列:解码 → CUT3R 循环重建 → 逐帧写出深度、置信度、彩色图与相机参数
$ python demo.py --model_path src/cut3r_512_dpt_4_64.pth --seq_path examples/001 --size 512 --vis_threshold 1.5 --output_dir tmp点云与原版相对 L2 误差 1.9e-4;写出的 PNG 解码后像素完全相同
优化后的代码与补丁autooptm/CUT3R-ao计时单位:一次 encode() 请求(一组文本 → 单位范数向量)
$ python examples/sentence_transformer/applications/computing-embeddings/computing_embeddings.py与 fp32 输出的余弦相似度 0.99999
优化后的代码与补丁autooptm/sentence-transformers-ao计时单位:官方 10 分钟教程的预告片,端到端渲染一帧(解码 → 特效 → 合成 → ffmpeg 编码)
$ python docs/_static/code/getting_started/moviepy_10_minutes/trailer.py像素差异不超过 1 个码值(PSNR 51.7 dB)
优化后的代码与补丁autooptm/moviepy-ao计时单位:一步 ResNet-50 训练(端到端)
$ python train.py <data> --model resnet50与冻结的原版参考输出比对通过,含一组优化时未见过的数据
优化后的代码与补丁autooptm/pytorch-image-models-ao计时单位:detect.py 处理一张图:读取 → letterbox → yolov5s 前向 → NMS → 写出标注图
$ python detect.py --source data/images --weights yolov5s.pt逐位一致
优化后的代码与补丁autooptm/yolov5-ao计时单位:TinyLlama-1.1B-Chat 在 GSM8K 上做监督微调的一个优化器步(batch 16,bf16)
$ python finetune.py --model_name_or_path=ckpts/tinyllama-1.1b-chat --dataset_name=gsm8k --model_family=llama2 …每步训练 loss 与原版程序相差不超过 0.11%(原版自身重复运行相差 0.15%),梯度余弦相似度 0.9999。
优化后的代码与补丁autooptm/shallow-vs-deep-alignment-ao计时单位:经 DeepSpeed 推理引擎做一次 batch 1 的自回归解码
$ python benchmark/deepspeed/run.py与冻结的原版参考输出比对通过,含一组优化时未见过的数据
优化后的代码与补丁autooptm/DeepSpeed-ao计时单位:nerfacto 在 4096 条光线上的一次训练迭代
$ ns-train nerfacto --data data/blender/lego每步训练 loss 与原版程序相差不超过 0.011%,约合渲染 PSNR 0.0005 dB。
优化后的代码与补丁autooptm/nerfstudio-ao计时单位:整个训练循环:GPT-2(124M)在 wikitext-2 上 71 步优化,含预热
$ python run_clm.py --model_name_or_path openai-community/gpt2 --dataset_name wikitext --dataset_config_name wikitext-2-raw-v1 …训练 loss 3.387(原版 3.376),验证困惑度 19.74(原版 19.55)
优化后的代码与补丁autooptm/transformers-ao计时单位:DiT-XL/2 单卡一个训练步(批大小 16)
$ torchrun --nnodes=1 --nproc_per_node=1 train.py --model DiT-XL/2 --data-path <train dir> --global-batch-size 16 …每步 loss 与原版 fp32 相差不超过 1.6e-4,梯度一致(余弦 1.000,相对 L2 0.004),在未参与优化的批次上同样成立。
优化后的代码与补丁autooptm/DiT-ao计时单位:一张 COCO 图片,从解码到输出还原尺寸的检测框
$ python ultralytics/cfg/__init__.py predict model=yolov12n.pt source=data/val2017 …检测结果与原程序逐位一致(最大差 0),24 张留出图片上同样一致。
优化后的代码与补丁autooptm/yolov12-ao计时单位:用 Wan 2.2 VAE 编码一段视频(diffusers)
$ python wan22_encode.pylatent 与 fp32 编码结果的 PSNR 为 78.3 dB
优化后的代码与补丁autooptm/ao-vae-bench-ao计时单位:生成一张 256×256 图像(250 步采样加 VAE 解码)
$ python inference.py --config configs/reproductions/lightningdit_xl_vavae_f16d32_64ep_cfg.yaml --demo生成图像与原程序输出的 PSNR 为 41.6 dB(留出批大小上为 40.0 dB)。
优化后的代码与补丁autooptm/LightningDiT-ao计时单位:处理一段视频:解码 → 上传到 GPU → CoTracker3 离线模式跟踪 10×10 网格点 → 在每一帧上画出轨迹 → 写出 mp4
$ python demo.py --grid_size 10跟踪点、可见性标志和渲染出的标记颜色与原版程序逐位一致,在未参与优化的留出视频与网格大小上同样成立
优化后的代码与补丁autooptm/co-tracker-ao计时单位:一段视频用 detect-adaptive 端到端打分(解码 → 逐帧评分 → 切点判定 → 场景列表)
$ python scenedetect/__main__.py -i demo.mp4 detect-adaptive list-scenes -n评分逐位一致,切点列表与原版相同
优化后的代码与补丁autooptm/PySceneDetect-ao计时单位:一张图加一条提示词走完官方推理脚本(SwinT 主干、BERT、可变形解码器 → 检测框)
$ python demo/inference_on_a_image.py -c groundingdino/config/GroundingDINO_SwinT_OGC.py -p weights/groundingdino_swint_ogc.pth -i .asset/cat_dog.jpeg -o out -t "cat ear."检测框位移小于 0.1 像素
优化后的代码与补丁autooptm/GroundingDINO-ao计时单位:用 SAM 2.1 hiera-b+ 端到端跟踪一段 DAVIS 2017 验证集视频:解码帧、加入首帧掩码、逐帧传播、写出标签 PNG
$ python ./tools/vos_inference.py --sam2_cfg configs/sam2.1/sam2.1_hiera_b+.yaml --sam2_checkpoint ./checkpoints/sam2.1_hiera_base_plus.pt --base_video_dir <DAVIS>/JPEGImages/480p … --output_mask_dir ./outputs/davis_2017_pred_pngs写出的标签 PNG 与原版程序至少 99.9% 的像素完全相同(只有少量目标边界像素的标签变化),未参与优化的留出视频上同样成立
优化后的代码与补丁autooptm/sam2-ao计时单位:一次 txt2img 请求(SD 1.5,20 步,512–768 像素),直到返回 PNG
$ python launch.py --api --nowebui解码后的图像与原版服务器输出相比 PSNR 48.2 dB,未参与优化的请求上为 51.6 dB。
优化后的代码与补丁autooptm/stable-diffusion-webui-ao计时单位:一步 256×256 的 REPA-E 训练(SiT-B/2 + SD-VAE + DINOv2-B),batch 4
$ python train_repae.py --model=SiT-B/2 --vae=f8d4 --enc-type=dinov2-vit-b --batch-size=4 --mixed-precision=fp16 …每步 loss 与原版相差 0.9% 以内,小于命令自带 fp16 本身带来的波动
优化后的代码与补丁autooptm/REPA-E-ao计时单位:用 HunyuanVideo VAE 编码一段 33 帧视频(diffusers)
$ python hunyuan_encode.pylatent 与 fp32 编码结果的 PSNR 为 50.9 dB
优化后的代码与补丁autooptm/ao-vae-bench-ao计时单位:一段短视频 2 倍插帧:解码 → SSIM 检查 → IFNet → 编码
$ python inference_video.py --video=demo.mp4 --exp=1最差像素相差 1 个码值(PSNR 57.7 dB)
优化后的代码与补丁autooptm/ECCV2022-RIFE-ao计时单位:一张 1280×720 JPEG 帧:解码 → SAM 3 文本提示("person")检测与分割 → 0.5 阈值、掩码上采样回原尺寸
$ python perf/confirm_e2e.py --arm baseline --frames 64每个查询的检测判定与原版完全相同;分数与掩码与原版的余弦相似度为 0.99999
优化后的代码与补丁autooptm/sam3-ao计时单位:重建一个场景(解码、VGGT-1B 推理、反投影、COLMAP 重建)
$ python demo_colmap.py --scene_dir=examples/kitchen输出的世界坐标点云与原版相比 PSNR 97.2 dB(相对 L2 误差 1.8e-4)。
优化后的代码与补丁autooptm/vggt-ao计时单位:一段音频经新的 websocket 会话流式送入 faster_whisper 服务端(首包 → 覆盖整段的转写 → 结束音频),Whisper small
纯库项目,没有入口命令:计时的是一段调用其公开 API 的基准脚本。
$ python ao_bench.py固定与留出片段的转写文本与原版程序逐字一致
优化后的代码与补丁autooptm/WhisperLive-ao计时单位:Fast3R ViT-L/512 对 20 帧演示视频做一次多视图重建
$ python bench_infer.py通过了对照原版程序的输出校验(校验基准在优化开始前冻结)
优化后的代码与补丁autooptm/fast3r-ao计时单位:一个优化器步(8 个 64×128 token 的微批次,共 65,536 个 token)
$ python main.py loader.global_batch_size=512 … model=small algo=bd3lm data=lm1b-wrap model.length=128 block_size=16 mode=train …相同批次上训练损失与原版相差不超过 1.1%,未参与优化的批次上为 0.77%。
优化后的代码与补丁autooptm/bd3lms-ao计时单位:一步 LJSpeech 训练(生成器 → MPD + MSD 判别器 → 生成器更新),batch 16
$ python train.py --config config_v1.json两个 epoch 后 mel L1 为 0.544 / 0.539(原版 0.545 / 0.544)
优化后的代码与补丁autooptm/hifi-gan-ao计时单位:train.py 的一次训练迭代(shakespeare_char)
$ python train.py config/train_shakespeare_char.py --compile=False --max_iters=400 --eval_interval=200 --log_interval=10loss 轨迹相对误差 8e-5 以内,梯度余弦 ≥ 0.99999
优化后的代码与补丁autooptm/nanoGPT-ao计时单位:一段视频经 VAE 往返(编码 → 解码 → 帧,diffusers)
$ python decode.py与 fp32 参考结果的 PSNR 为 62.9 dB
优化后的代码与补丁autooptm/h3-vae-bench-ao计时单位:处理一张照片:人脸检测、修复、背景 2 倍超分并写出结果
$ python inference_gfpgan.py -i inputs/whole_imgs -o results -v 1.3 -s 2修复后的图像与原版相比 PSNR 48.4 dB,未参与优化的照片上为 47.4 dB。
优化后的代码与补丁autooptm/GFPGAN-ao计时单位:VibeVoice-ASR 在示例数据集上的一步 LoRA 微调(解码 → 分词 → 组 batch → 前向/反向)
$ python finetuning-asr/lora_finetune.py --model_path microsoft/VibeVoice-ASR --data_dir finetuning-asr/toy_dataset --output_dir out --num_train_epochs 3 --per_device_train_batch_size 1 --learning_rate 1e-4 --bf16 --report_to noneloss 相对误差 6.5e-2 以内,梯度余弦 0.885;提供恢复原路径的开关,由使用者取舍
优化后的代码与补丁autooptm/VibeVoice-ao计时单位:tabicl.train 预训练的一步(stage 1 配方,从 mix-SCM 先验生成 32 张合成表格,bf16)
$ python bench_train.py每步 loss 与原版程序的相对差在 2e-5 以内(即原版自身重复运行的波动),梯度余弦 1.0
优化后的代码与补丁autooptm/tabicl-ao计时单位:train.py 的一个训练步(16 张 coco128 图:H2D → fp16 前向 → loss → 反向 → 优化器)
$ python train.py --data coco128.yaml --weights yolov5s.pt --img 640 --epochs 3 --batch-size 16loss 相对误差 2e-3 以内,梯度余弦 ≥ 0.996
优化后的代码与补丁autooptm/yolov5-ao计时单位:按配置的 batch 在 COCO 上跑一次 Faster R-CNN R50-FPN 训练迭代
$ python tools/train.py configs/faster_rcnn/faster-rcnn_r50_fpn_1x_coco.py与冻结的原版参考输出比对通过,含一组优化时未见过的数据
优化后的代码与补丁autooptm/mmdetection-ao计时单位:CDiT-XL/2 bf16 训练一步,batch 4、224 px,合成轨迹数据
$ python train.py --config config/ao_synth.yaml --epochs 2 --bfloat16 1 --torch-compile 0 …loss 与原版相差 1.2e-7 以内;梯度余弦 1.0,落在原版自身多次运行的波动范围内
优化后的代码与补丁autooptm/nwm-ao计时单位:转写一个音频文件(--model small,float16,不做对齐)
$ python whisperx/__main__.py audio.wav --model small --compute_type float16 --no_align --output_dir out特征与原实现相差不超过 0.016
优化后的代码与补丁autooptm/whisperX-ao计时单位:一条序列走完:TimeSeries → Scaler → 构建 NBEATSModel → 训练 3 轮 → 预测
纯库项目,没有入口命令:计时的是一段调用其公开 API 的基准脚本。
$ python ao_bench.pyloss 相对误差 2e-3 以内,MAPE 不变
优化后的代码与补丁autooptm/darts-ao这些数字从哪来
计时对象是项目自己的命令跑完一个工作单位的墙钟时间,包含数据读取、预处理和写盘,而不只是模型的前向计算。
优化开始前,先固定输入集、生成参考输出、测出主机噪声。此后每项改动都与这份冻结的基线对比,多次采样取中位数。
推理类项目直接比对输出(逐位一致、PSNR 或余弦相似度),训练类项目比对 loss 曲线和梯度。超出容差的改动一律回滚,不计入结果。
交付的是一个标准补丁:文件、参数、输出都和原来一样,优化默认开启,每处改动都附带一个可切回原实现的开关。
以上是我们自己提交公开仓库得到的结果,所用显卡和命令都标在每张卡片上。同一段代码换一张卡、换一份输入,结果都会不同,所以你的仓库会先做一次免费估算,再由你决定是否继续。