Skip to content
View fei121's full-sized avatar
  • University of Shanghai for Science and Technology
  • University of Shanghai for Science and Technology
  • 00:58 (UTC -12:00)

Highlights

  • Pro

Block or report fei121

Block user

Prevent this user from interacting with your repositories and sending you notifications. Learn more about blocking users.

You must be logged in to block users.

Maximum 250 characters. Please don’t include any personal information such as legal names or email addresses. Markdown is supported. This note will only be visible to you.
Report abuse

Contact GitHub support about this user’s behavior. Learn more about reporting abuse.

Report abuse
fei121/README.md

你好,我是 Yufei 👋

LLM 推理优化 · AI Agent 工程 · 多模态智能

上海理工大学

GitHub Python Focus

关于我

我关注如何将模型能力转化为可复现、可评测、可部署的工程系统。当前的实践重点包括大语言模型量化与推理性能分析、AI Agent 的工具与检索能力,以及多模态时空感知。

我尤其重视从实验结果出发定位问题根因,并将结论沉淀为可复核的数据、脚本与文档。

技术方向

方向 实践重点
LLM 推理优化 后训练量化、精度评测、吞吐与时延分析、异常归因
AI Agent 工程 工具发现、检索增强、上下文与知识库能力
多模态智能 RGB 与伪深度融合、时空特征建模、视觉里程计
工程方法 可复现实验、模块消融、结果可视化、技术文档化

代表项目

面向 Qwen3-8B 的后训练量化、推理性能评测与精度损失归因项目。

  • 对比 vLLM + LLM CompressorAutoRound + vLLMTensorRT-LLM + ModelOpt 三条量化与部署链路。
  • 在统一的 GSM8K / C-Eval 评测口径下,比较 BF16、INT8 与 MXFP4 的精度和性能。
  • 通过 hidden-state cosine、SQNR、P99 误差、模块跳过与累计消融,将特定 INT8 异常的主要误差定位到 mlp.down_proj
  • 在 vLLM INT8 W8A8 链路中,输出吞吐由 BF16 的 261 tokens/s 提升至 1,085 tokens/s,同时保持接近 BF16 的评测精度。

面向复杂问题的深度检索 Agent。基于 ReAct 循环完成问题拆解、搜索路径规划、网页阅读、证据提取与多源交叉验证,并包含搜索源降级、SSE 心跳、超时和上下文预算保护。

面向大语言模型联网搜索能力的实验、评估与可观测分析框架。覆盖参数扫描、搜索触发与引用追踪、规则评估、LLM-as-a-Judge、Pareto 权衡分析和科研风格可视化。

面向 AI Agent 的 OpenAPI 文档知识库与混合检索服务。将分散的 API 文档结构化为可搜索、可回查的工具目录,通过 MCP 和 HTTP 提供向量检索、BM25 与跨知识库候选融合能力。

面向保险条款 PDF 的文档理解与结构化责任拆解服务。结合 PDF 解析、Markdown 结构化、FAISS / BM25 混合检索、LLM 工作流与字段级置信度评估,输出责任范围、等待期、既往症与责任免除等信息。

面向理赔流程的 OCR + LLM 文档理解服务。支持发票、身份证、银行卡、自定义 JSON Schema 抽取,以及病历与发票匹配;通过 FastAPI 对外提供统一的结构化 API。

开源项目学习与实践(Fork)。关注 Agent 的本地化长期记忆、符号化短期记忆和分层信息组织,探索如何降低长任务中的上下文负担并提升信息可追溯性。

技术栈

Python, PyTorch, FastAPI, SQLite, Linux, Git Hugging Face NumPy Pandas Matplotlib

vLLM TensorRT-LLM Hugging Face SQLite

正在探索

  • 大模型量化的精度—性能权衡与可解释性分析。
  • 面向 AI Agent 的工具检索、结构化 API 知识库与上下文优化。
  • 将研究型实验打磨为可复现、可部署的工程成果。

联系方式

欢迎通过 GitHub @fei121 交流 LLM 推理优化、AI Agent 与开源工程实践。

Popular repositories Loading

  1. Qwen3-8B-Quantization Qwen3-8B-Quantization Public

    Qwen3-8B quantization study across vLLM, TensorRT-LLM, AutoRound, INT8, and MXFP4

    Python 2

  2. TencentDB-Agent-Memory TencentDB-Agent-Memory Public

    Forked from TencentCloud/TencentDB-Agent-Memory

    TencentDB Agent Memory delivers fully local long-term memory for AI Agents via a 4-tier progressive pipeline, with zero external API dependencies.

    TypeScript

  3. VSTFusion-VO VSTFusion-VO Public

    Forked from tongyu0924/VSTFusion-VO

    A Transformer-based framework for monocular visual odometry using multimodal RGB and pseudo-depth fusion.

    Python

  4. fei121 fei121 Public