GLM-5.3-Flash-J-Space-Capability-Realization-Report

把大模型智能体能力评测做成可读报告,一眼看清真实水平

这是一个围绕 GLM-5.3-Flash 与 J-Space 认知套件的能力实现报告型开源项目,核心是把 J-Space Cognition Suite 的评测结果以基准展示(benchmark presentation)的形式公开出来。它解决的是大模型能力评测中「结果不透明、难以复现、缺乏横向对比」的问题:通过 agent-skills、deepseek-harness、dsh-plugin 等技术栈,把模型在智能体任务中的表现整理成可读的报告,让开发者能直观看到 GLM-5.3-Flash 在 J-Space 场景下的真实能力边界。项目定位偏向评测与安全方向,适合关注模型能力验证、智能体评测方法论的人群参考,也可作为同类基准测试的展示模板。

开源 unknown 评测安全
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1022
维护状态 较活跃
是否开源 是
定价模式 unknown

项目数据

分类评测安全
开发团队Tiger3807861189
所属国家
官网地址
定价模式unknown
价格说明定价信息待确认
访问状态
是否开源是
开源协议NOASSERTION
主要语言
技术栈/模型agent-skills,ai-agent,benchmark,deepseek,deepseek-harness,dsh,dsh-plugin
GitHub 星标★ 1022
30天Star增速
HF 下载量
上线时间2026-08-16 00:00:00
最近更新2026-09-24 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-25
浏览次数0

使用教程

难度:入门 约 10 分钟 部署方式:本地安装 6 步

环境要求

  • 一个可用的 AI 宿主,且支持用户级 Skills 目录加载
  • Python 3 解释器(python / python3 / py -3 之一)
  • 能访问 GitHub 下载或克隆仓库(或可访问文件的 AI Agent)

安装与启动步骤

  1. 1获取仓库

    下载或克隆本仓库到本地,保持完整目录结构,不要只取其中单个文件。

    git clone https://github.com/Tiger3807861189/GLM-5.3-Flash-J-Space-Capability-Realization-Report.git
  2. 2定位 Skills 目录

    查阅你所使用 AI 宿主的配置或文档,确认它的用户级 Skills 目录实际路径。

  3. 3复制 j-space 目录

    把完整的 j-space/ 目录整体复制进去,最终入口必须是 /j-space/SKILL.md。

    cp -r j-space /your/skills-directory/
  4. 4运行完整性校验

    用宿主机可用的 Python 3 命令执行校验脚本,替换成实际的 python/python3/py -3。

    python3 /your/skills-directory/j-space/scripts/verify_suite.py
  5. 5重载宿主

    宿主在启动时才会发现 Skills,安装后需重启或重载宿主才能识别该 Skill。

  6. 6(可选)让 Agent 代装

    把 README 中的安装提示词交给可访问文件与仓库的 Agent,由它自动定位目录并安装校验。

关键配置

配置项必填说明示例
skills-directory是AI 宿主的用户级 Skills 目录,j-space/ 的安装目标位置/your/skills-directory
python-command是用于运行 verify_suite.py 的 Python 3 命令python3

如何确认成功

校验脚本无报错,且 /j-space/SKILL.md 存在,重载后宿主能识别并调用该 Skill。

常见问题

Q:目录里只复制 SKILL.md 可以吗?

A:不行。SKILL.md 通过相对路径路由到 modules/、references/ 和 scripts/,目录必须保持完整,否则功能会缺失。

Q:找不到 Skills 目录怎么办?

A:README 未指定固定路径,需先查看你所用宿主的配置或文档确认;也可以直接让能访问文件的 Agent 代为探测并安装。

Q:宿主没有原生 Skill 加载器怎么办?

A:不要按安装流程处理。README 建议改为选择性 system/developer instruction 集成方式,把该套件作为指令内容引入。

Q:这个项目会修改模型权重吗?

A:不会。J-Space 只在推理时生效,模型权重与训练过程保持不变。

Q:再分发时要注意什么?

A:把 j-space/ 作为独立包分发时,需同时附带仓库级的 LICENSE 和 THIRD_PARTY_NOTICES.md。

注意事项

  • README 只给出手动安装(Option A)与让 Agent 安装(Option B)两条路径,未提供 pip/npm 等包管理器安装方式。
  • 安装入口必须落在 /j-space/SKILL.md,复制时不要改变 j-space 目录名。
  • fast、full、loop 是套件提供的不同执行模式,可选控制器只记录长任务状态,不负责选择解决方案。

核心亮点

  • 以报告形式公开评测结果,比单纯跑分更易理解模型能力边界
  • 技术栈覆盖 agent-skills、dsh-plugin 等,贴近真实智能体任务场景
  • 聚焦评测安全方向,对模型能力验证与方法论讨论有参考价值

不足之处

  • 项目以报告展示为主,缺少可复用的评测框架或工具代码
  • 语言与文档细节未明确,社区生态和后续维护待观察

适用场景

  • 开发者评估 GLM-5.3-Flash 在智能体任务中的实际表现
  • 团队参考其评测展示方式设计自己的模型基准报告
  • 研究者了解 J-Space 认知套件的能力实现与评测思路

替代项目

lm-evaluation-harness、HELM、OpenCompass

项目介绍

GLM-5.3-Flash-J-Space-Capability-Realization-Report 是评测安全领域的开源项目,由 Tiger3807861189 开发,是 2026 年新上线的项目。

在全站 13,090 个收录项目中,它的 GitHub 星标数(1,022)位列前 30%,在评测安全分类中处于中上游。

项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-24。

它主要面向的使用场景是:开发者评估GLM-5.3-Flash在智能体任务中的实际表现。同类可对比的替代方案包括 lm-evaluation-harness、HELM、OpenCompass。

上一篇:eval-assist

下一篇:没有了!

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1517 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
deepteam 开源

自动模拟越狱攻击,提前测出 LLM 安全漏洞

DeepTeam is a framework to red team LLMs and AI agents.

★ 2937 2026-09-12