archive
2026年08月のAIニュース
159件。見出しから個別記事と一次情報の出典へ移動できます。
10件
- AI研究arXiv論文:自己改善AIは課題の順番で成績が変わる——複数回実行と並べ替えで弱点を検証arXiv(未査読プレプリント)
- AI研究arXiv論文:文書AIの『見ている版』ずれを防ぐStagedWorkspace——OfficeQAで最大12.1点改善arXiv(査読中プレプリント)
- AI研究arXiv論文:画像生成の計算を10分の1にするOYS——5ステップで50ステップの品質89〜94%arXiv(未査読プレプリント)
- AI研究arXiv論文:4K画像を61秒で編集するEditBridge——2K処理は3.6〜8.4倍高速化arXiv(未査読プレプリント)
- ChatGPTChatGPT、欧州31市場に広告を拡大——8月24日開始・回答とは見分けやすく表示OpenAI / Reuters
- ClaudeAnthropicの『Claude』、15種の標的中14種でタンパク質結合体の設計に成功Anthropic Research
- AIニュースCerebras、新システム『CS-4』を発表——GPU比で最大30倍の推論速度Cerebras / The Next Platform
- AIニュースOpenAI、最上位AI『Astra』の推論に監視コストを約20%上乗せThe Register
- AIニュースエヌビディアH200、中国へ初の大量出荷——ByteDanceとTencentに各1万枚Financial Times
- AIニュースLinear、課題の約半分をAIが作成——コーディングAI利用チームはPRが111%増Linear (How teams build)
7件
- AI研究arXiv論文:操作できる動画世界モデルをAIプレイヤーで評価——PlayWorld、9モデルが長期課題で苦戦arXiv(査読前論文)
- AI研究arXiv論文:AIは証明付きソフトをリポジトリ単位で作れるか——Vero、最強構成も43件中27件arXiv(査読前論文)
- AI研究arXiv論文:小学5年超の知識を除いてAIを学習——LittleLearner、知識獲得を追える実験環境arXiv(査読前論文)
- AI研究arXiv論文:動画AIが「今」と「過去」を両立——StreamTTT、4Bで8Bモデル級arXiv(査読前論文)
- AI研究arXiv論文:研究AIは「発明家」より「改善役」——7モデル・36長期課題で検証arXiv(査読前論文)
- AI研究arXiv論文:許諾されたデータだけで1B言語モデルを学習——Mimir v1、デンマーク語で最高水準arXiv(査読前技術報告)
- AI研究arXiv技術報告:操作型の動画世界モデルAlayaWorld更新——3D点群の記憶で長時間の一貫性を改善arXiv(査読前技術報告)
7件
- AI研究arXiv論文:AIが論文ポスター制作の手順自体を改善——AutoDesign、平均スコアを12.4点向上arXiv(査読前論文)
- AI研究arXiv論文:AI科学者が画像・音声・3Dなど生データから論文作成——OmniScientist、36課題を完走arXiv(査読前論文)
- AI研究arXiv論文:動画生成AIの圧縮表現を意味重視に——V-RAE、学習収束を最大6倍高速化arXiv(査読前論文)
- AI研究arXiv論文:コーディングAIは同じ命令でも実行経路で成績急落——QuoteBench、最大73.2ポイント低下arXiv(査読前論文)
- AI研究ISWC 2026論文:議会記録RAGが発言者の専門性と政党の幅を考慮——引用の正確さ1.00arXiv(ISWC 2026 In-Use Track採択論文)
- AI研究ECCV 2026 Workshop口頭論文:画像AIの例示はいつ1本のタスクベクトルに圧縮できるかを整理arXiv(ECCV 2026 Workshop口頭採択論文)
- AI研究ECCV 2026口頭論文:3D視覚AIの情報を「ばらつき」でなく「範囲」で削減——CoverPrunearXiv(ECCV 2026口頭採択論文)
8件
- AI研究arXiv論文:ドローンAIが過去を覚え、数手先を考えて飛行——DreamFlyが未知環境でも改善arXiv(査読前論文)
- AI研究arXiv論文:AIエージェントはAPIをまたぐと急失速——VAKRA、深い推論で性能50%以上低下arXiv(査読前論文)
- AI研究arXiv論文:動画生成AIが自分で指示と設定を改善——人の比較で最大69%支持arXiv(査読前論文)
- AI研究COLM 2026論文:AI同士が文章を介さず内部状態で連携——StateBridge、26条件中22で最高級arXiv(COLM 2026採択論文)
- AI研究AIES 2026論文:AI安全は規則か性格づけか——規模より未知状況での崩れやすさが重要arXiv(AIES 2026採択論文)
- AI研究ECCV 2026論文:人型ロボットの動きを153時間で評価——HumanTrackerが足滑りも判定arXiv(ECCV 2026採択論文)
- AI研究COLM 2026論文:AI学習で効く文章は途中で変わる——初期は文学、後期はSTEMが強く影響arXiv(COLM 2026採択論文)
- GitHub CopilotGitHub Copilotに「Grok 4.6」追加——長時間のコーディングと道具操作向けGitHub Changelog
7件
- AI研究IJCAI/ECAI 2026 Workshop論文:危険を止めた時点だけ教えて安全AIを学習——RCIが違反率を低減arXiv(SPAI 2026 / IJCAI/ECAI 2026 Workshop採択)
- AI研究ECCV 2026論文:画像AIが文脈を無視する弱点を補正——物体の幻覚率を36%低減arXiv(ECCV 2026採択)
- AI研究ICML 2026論文:異常動画なしで監視AIを学習——文章を時系列映像の代わりに使うTD-VADarXiv(ICML 2026採択)
- 研究論文arXiv論文:強いAIが作った実行用ハーネスで小型AIを再学習なしに強化——平均成績0.49から0.91arXiv(AI4AI at Test-Time)
- 研究論文arXiv論文:企業のChatGPT利用を1500社・1700万件超で分析——若手ほど利用密度が高いarXiv(How Organizations Use AI)
- 研究論文arXiv論文:悪意あるAIスキルが正解を保ったまま処理を遠回り——時間92.45%増の攻撃を検証arXiv(Convergent Detour Hijacking)
- GitHub CopilotGitHub Copilotに「Gemini 3.7 Flash」——Web・アプリ開発と検証を改善GitHub Changelog
12件
- GitHub CopilotMicrosoft「MAI-Code 1.1」公開——CLI成績22%向上、価格75%減Microsoft AI 公式
- GitHub CopilotGitHub CopilotのJetBrains版、会話をまたぐ記憶とOllama接続に対応GitHub Changelog 公式
- GitHub CopilotGitHub Copilot、AI料金の元になるトークン数をモデル別に表示GitHub Changelog 公式
- SHEarXiv論文:AIエージェントの安全設定を失敗から更新——攻撃成功率を3.1分の1へarXiv(cs.AI、未査読・学会採択記載なし)
- Sci-VBenchCOLM 2026論文:科学動画AIは見た目が良くても因果を誤る——16モデル・1253例で評価COLM 2026/arXiv(cs.CV)
- Stealing Reasoning TracesarXiv論文:暗号化したAIの推論記録を別モデルで復号——公開ログ31万件超から認証情報も検出arXiv(cs.CR、未査読・学会採択記載なし)
- AI研究arXiv論文:手術動画でロボットを事前学習——4課題の平均成功率63.5%から77.8%へarXiv(cs.RO)
- AI研究arXiv論文:数学研究AIが未解決定数の境界を更新——専門家が新規と認める着想を提示arXiv(cs.AI)
- AI研究arXiv論文:画面操作AIが失敗を振り返り自己改善——6評価で平均精度7.4%向上arXiv(cs.CV)
- Catastrophic RememberingarXiv論文:AI用の指示書は寿命中に226%肥大化——理由をコメントで残すと余分な指示を99.3%削減arXiv(cs.AI、未査読)
- SkillZiparXiv論文:AIエージェントの手順書を実行テストなしで圧縮——SkillZipが例外を残して重複を整理arXiv(cs.AI、未査読)
- V-FiLLMarXiv論文:金融表を読むAIは計算が深いと精度最大51%低下——正解を計算で保証するV-FiLLMarXiv(cs.AI、査読中)
18件
- CoinRAGarXiv論文:長文RAGを細かな『情報の粒』で高速化——CoinRAG、同じ待ち時間で回答品質を平均5.3%改善arXiv(cs.CL、未査読)
- SkillProxarXiv論文:AIエージェントの手順書を失敗から自動改善——SkillProx、最強比較法より平均3.0ポイント向上arXiv(cs.AI、未査読)
- SynthExarXiv論文:AIが複雑な天然物の合成計画を複数案から改善——専門家が主要工程を人の発表例と同等と評価arXiv(cs.MA、未査読)
- ChatGPT月125ドル・利用量5倍の上位席、ChatGPT Businessに追加OpenAI公式
- OpenAI承認制で提供、OpenAIのサイバーAI「GPT‑5.6‑Cyber」OpenAI公式
- GitHub CopilotGitHub Copilot Web版、会話を最小化——メッセージ別の利用量も表示GitHub Changelog
- TEPAarXiv論文:古い記憶を無効化するTEPA——状況反転テストで0.950arXiv(cs.AI、未査読)
- CoBaarXiv論文:CoBa、精度を保ち計算量指標を58.9%削減arXiv(cs.AI、未査読)
- ResidencyRLarXiv論文:医療AIを模擬診療で訓練——診断精度81%→88%arXiv(cs.AI・cs.CL、未査読)
- Google Ads / Google AnalyticsGoogle広告・Analyticsに分析AI——文章から可視化、同業平均との比較もGoogle公式ブログ
- Muse Glimmer 30BMeta「Muse Glimmer 30B」公開——画像・動画・ツール操作をローカルで扱うApache 2.0モデルHugging Face公式ブログ
- NVIDIA Magpie TTSNVIDIAの音声生成「Magpie TTS」、12言語対応——韓国語・アラビア語・ポルトガル語を追加NVIDIA(Hugging Face公式ブログ)
- TTS評価ベンチマークarXiv論文:音声AIの自動採点は「自然さ」の違いを見分けきれない——860音声・10観点で検証arXiv(cs.SD、Work in progress・未査読)
- MMDiffICML 2026 Workshop論文:画像AIの内部機能を特定して制御——安全攻撃の成功率を24%低減ICML 2026 Trustworthy AI for Good Workshop採択論文(arXiv)
- BDH-CQarXiv論文:150Mの小型AI、ARC-AGI-1で29.5%——1問0.0007ドル相当の推論を報告arXiv(cs.NE、未査読)
- Microsoft CopilotMicrosoft「MAI-Image 2.6」公開——画像内の文字が改善、Arenaで2位Microsoft AI 公式
- OllamaNVIDIA「Nemotron 3.5 Lightning」公開——Ollamaなどで手元実行NVIDIA Blog 公式
- CodexNeMo Switchyard 0.2公開——AI接続を自動選択NVIDIA NeMo公式GitHub Release
9件
- OpenAIOpenAI、次期AI「Astra」のサイバー能力を最高警戒級の可能性——一部の社内作業を停止OpenAI(公式)
- ChatGPTChatGPT無料版、GPT-5.6 Lunaの文章チャットを回数無制限へ——難問向けThinkボタンも追加OpenAI(公式)
- ClaudeClaude Fable 5、生物質問で低性能モデルへ切り替わる回数を約85%削減——危険研究は引き続き制限Anthropic(公式)
- ChatGPTOpenAIと米心理学会、若者のAI利用指針を共同開発——保護者・学校・医療者向け資料を計画OpenAI(公式)
- AI研究arXiv論文:同じAIでもWeb検索で正答率が最大8ポイント低下——同じ質問の回答も最大21%不一致arXiv(cs.HC、未査読)
- AI研究arXiv論文:AI文章の事実を主張ごとに照合するHallDetect——家庭向け機器で4評価中3つの比較法を上回るarXiv(cs.CL、未査読)
- CreativeInstructarXiv論文:AIの創造性を保つCreativeInstruct——人の70.3%が通常の調整済みAIより創造的と評価arXiv(プレプリント、未査読)
- Fisher-R1arXiv論文:統計を任せたAIは計算が動いても結論を誤る——Fisher-R1が425課題で改善arXiv(プレプリント、未査読)
- BAMMISMIR 2026論文:AI音楽の検出は実際のテレビ放送で精度低下——40時間のBAMMで検証arXiv(ISMIR 2026採択論文)
7件
- GitHub CopilotGitHub Code Quality、自動Copilotレビューを初期設定から解除——必要な組織だけ選んで有効化GitHub Changelog(公式)
- 研究論文arXiv論文:長い作業をするAIの「最初の致命的ミス」を追跡——失敗486件を人手で注釈arXiv(cs.AI、未査読プレプリント)
- 研究論文arXiv論文:AIは古い会話に引っ張られ道具選択を32.1%変更——正しい最新状態を学ぶ方法を提案arXiv(cs.AI、未査読プレプリント)
- 研究論文arXiv論文:金融AIは経験で最大19.37点向上——120課題で自己改善と規則違反を評価arXiv(cs.AI、未査読プレプリント)
- 研究論文arXiv論文:コードAIのスキルを関係図で共同更新——テスト生成と誤報除外で再利用性を改善arXiv(cs.SE、未査読プレプリント)
- 研究論文arXiv論文:AI対話で事件直後の陰謀論への信念が低下——米国成人1507人を2実験で比較arXiv(cs.HC、未査読プレプリント)
- 研究論文arXiv論文:780ページの表検索、埋め込みRAGの15.7%に対しREADは58.8%——単位切断を回避arXiv(cs.AI、未査読プレプリント)
14件
- GitHub CopilotGitHub Copilotコードレビュー、軽量・標準の深さを正式提供——PRごとと組織全体で選択GitHub Changelog(公式)
- GitHub CopilotGitHub、Claude・Codexなどエージェント別の利用数をAPIで集計——1日・28日レポートに追加GitHub Changelog(公式)
- GitHub CopilotGitHub Copilot、企業向けMCP許可・拒否リストを正式提供——不明な設定は安全側で遮断GitHub Changelog(公式)
- Gemini NotebooksGemini Notebooks、資料の自動追加に対応——Drive・YouTube・Webを定期ワークフローで更新Google Workspace Updates(公式)
- 研究論文arXiv論文:AIスキルの再利用を3種類の痕跡で監査——3万6446件を調査、F1は0.898arXiv(cs.AI、プレプリント)
- 研究論文arXiv論文:調査AIの長い失敗記録を自動監査——1243件、平均6万5100トークンで原因を特定arXiv(cs.AI、プレプリント)
- 研究論文arXiv論文:音・映像・文章を扱えるAIも矛盾に弱い——人88.64%、最良モデル73.17%arXiv(cs.AI、プレプリント)
- GitHub CopilotGitHub Copilot更新:CLIに/worktreeと/rewind——並行作業と巻き戻し、VS Codeは横質問に対応GitHub Changelog(公式)
- GitHub CopilotGitHub Copilot、費用とPR数を並べるROI欄を追加——給与帯を変えて試算、因果関係には注意GitHub Changelog(公式)
- The Bitter Lesson of Tool Calling(AI研究)arXiv論文:AIの道具操作はJSONよりコードが有利な場合——14モデル中11、長い連鎖で差18.8ポイントarXiv(cs.CL、未査読プレプリント)
- MIST・SCOPE(AI研究)arXiv論文:正しいAIも誤ったヒントで答えを変更——1000問×4条件、全モデルで弱点を確認arXiv(cs.CL、未査読プレプリント)
- CalibForge(AI研究)arXiv論文:AI向け端末課題5431件を難易度調整——強いAIだけ解ける条件で学習効果を向上arXiv(cs.LG、未査読プレプリント)
- 研究論文arXiv論文:AI対戦の強さを中央値で74分の1の試合数で判定——途中終了しても信頼度を保証arXiv(cs.GT・cs.AI、プレプリント)
- 研究論文arXiv論文:AIは自分の作業環境をどこまで改善できるか——5モデル・4課題・111回で評価arXiv(cs.AI、プレプリント)
14件
- WeatherNext 2(Google DeepMind)Google、台風AI「WeatherNext 2」をオープン化——3日先予報が従来の2日先と同等、最大1000通りを計算Google DeepMind(公式)
- Mistral ShieldstralMistral、画像も文章も安全判定する「Shieldstral」公開——30億規模、16GB GPUで動作Mistral AI(公式)
- Reasoning Core(AI研究)arXiv論文:AIの推論教材を50種類の生成器で作成——正解可能でも学習に役立つとは限らないarXiv(未査読プレプリント)
- OctoLong(AI研究)arXiv論文:複数リポジトリをまたぐコード教材「OctoLong」——長文教材の12%置換で理解力が向上arXiv(未査読プレプリント)
- ContextWeave(AI研究)arXiv論文:仕事AIの記憶を1005課題で検証——短い要約より経験豊富な記録が有効、誤記憶には弱いarXiv(未査読プレプリント)
- Agent Plugins 1.0.0Google、AIエージェント部品を1つに束ねる「Agent Plugins 1.0.0」を支持——SkillsとMCPを共通形式で持ち運びGoogle Developers Blog(公式)
- Amazon Bedrock AgentCoreAWS、AIの「行動履歴」で許可を決めるTemporal Policiesを公開——高額操作は毎回人の承認AWS Machine Learning Blog(公式)
- GitHub Copilot / Kimi K3GitHub CopilotにKimi K3追加——ただしActions障害対応で展開を一時停止、入力100万トークン3ドルGitHub Changelog(公式)
- arXiv研究(画像ツール利用の因果監査)arXiv論文:画像を切り抜くAIは「見たふり」も——6モデル・5評価で、画像が回答に効かない失敗を確認arXiv(cs.AI、査読前論文)
- arXiv研究(ベンガル手話認識)arXiv論文:0.48MBの手話認識AIをスマホで実行——1万874枚を専門家確認、1画像3.98ミリ秒arXiv(cs.CV / cs.AI、査読前論文)
- ACM Multimedia 2026研究(動画物体数え上げ)ACM Multimedia 2026論文:混雑動画の数え間違いを62.01%削減——奥行きと重複除外を組み合わせACM Multimedia 2026採択論文 / arXiv
- 動画言語モデルの時間理解(AI研究)arXiv論文:動画AIは速い出来事の数え上げに弱い——2190本で検証、高頻度では正答0.2%arXiv(cs.AI、査読前プレプリント)
- GAUGE(AI研究)arXiv論文:動画生成AIは見た目が自然でも物理量を誤る——22課題でシミュレーターと比較arXiv(cs.AI・cs.CV・cs.RO、査読前プレプリント)
- G-STEER(AI研究)arXiv論文:調査AIの確認質問を約3分の1に——目的と根拠を整理して依頼文を改善arXiv(cs.AI・cs.CL、査読前プレプリント)
8件
- GeminiGoogle Classroom、Geminiで課題ごとの評価表を直接作成——先生が確認・編集して追加Google Workspace Updates(公式)
- SeGaBench(AI研究)arXiv論文:AIがコンパイラの見逃した高速化を発見——最良モデルは93.3%の課題で性能向上に成功arXiv(未査読プレプリント)
- ContinualSkillBench(AI研究)arXiv論文:AIエージェントの「スキル蓄積」は常に効くとは限らない——5分野500課題で検証arXiv(未査読プレプリント)
- 推論AIの評価方法(AI研究)arXiv論文:AIの「考える量」を同じ予算だけで比べるのは危険——推論法を3種類に整理arXiv(未査読プレプリント)
- Google Cloud API GatewayGoogle、3種類の生成AIを1つの入口で切り替え——モデル振り分けを公開プレビューGoogle Developers Blog(公式)
- ABSeeker(AI研究)arXiv論文:40億規模の検索AIが約300億規模に匹敵——8,500例と「答えから逆算する採点」で学習arXiv(未査読プレプリント)
- IRT for AI Safety(AI研究)arXiv論文:AI安全性テストを約10問まで圧縮できる場合——192モデル・8評価を項目反応理論で分析arXiv(未査読プレプリント)
- SciCode-Verified(AI研究)arXiv論文:科学コードAIの低得点はテスト側の欠陥が原因——65課題を修正すると正答率84〜98%arXiv(未査読プレプリント)
18件
- AIエージェント障害検知(AI研究)arXiv論文:AIエージェントの失敗を約200マイクロ秒で検知・再実行——成功率52%から73%へarXiv(未査読プレプリント)
- ParEvalLayer(AI研究)AIMLSystems 2026論文:AI評価は課題の15〜25%で結論できる場合も——途中点だけの公表に警鐘arXiv/AIMLSystems 2026採択論文
- 深掘り調査ベンチマーク(AI研究)arXiv論文:深掘り調査AIを500課題・31分野で検証——根拠確認まで追える評価データを公開arXiv(未査読プレプリント)
- EduZone(AI研究)arXiv論文:学校向けAIの安全性を10モデルで検証——教育特有の危険と長い会話に弱さarXiv(審査中プレプリント)
- Harness-R1(AI研究)arXiv論文:AI本体を変えず「実行の仕組み」を失敗から修正——成功率44.3%から53.6%へarXiv(未査読プレプリント)
- AtumAI(AI研究)arXiv論文:データセンターの運用ルールをAIが設計——配置・増減・電力の3課題で専門家案を上回るarXiv(未査読プレプリント)
- GitHub CopilotGitHub Copilotのクラウドエージェント、課題ごとに「考える量」を選択可能——高設定はAIクレジット増に注意GitHub公式Changelog
- GitHub CopilotGitHub Copilot、自動化をIssue・PRコメントから起動——文書更新、エラー調査、後続課題の作成に対応GitHub公式Changelog
- GeminiGoogle ClassroomのGemini、年齢制限を拡大——8月10日から小中高生も授業資料でクイズ・暗記カードを作成Google Workspace Updates公式ブログ
- Gemini in Google MeetGoogle MeetのAI議事録、共有画面のスクリーンショットを自動追加——グラフや図の説明不足を補完Google Workspace Updates公式ブログ
- AI予測評価(AI研究)arXiv論文:検索できる最先端AIのW杯勝敗予測は平均63.9%——ブックメーカー本命と同水準、AI多数決も効果なしarXiv(未査読プレプリント)
- 音声・文字入力のAI耐性(AI研究)arXiv論文:AIへの音声入力は文字入力より回答精度を下げやすい——考える量を増やしても音声の弱さは残るarXiv(未査読プレプリント)
- Claude Platform on AWSAWSだけで“本家Claude”を契約——Claude Platform on AWS一般提供、ただしデータはAWS境界外AWS公式Machine Learning Blog
- Genspark GenOfficeGenspark、AI版Officeを丸ごと公開——Word・Excel・PowerPoint・PDFを1つに、ソースコードもApache 2.0Genspark公式GitHub
- LFM2.5-2.6B(Liquid AI)スマホで毎秒30トークン、2.5GB未満——Liquid AIの2.6B小型AIが128K文脈とツール操作Liquid AI公式ブログ
- Gemini NotebooksGeminiに“案件ごとの頭脳”——NotebookLMと双方向同期、Pro・Plusにも展開Google公式ブログ
- DALL·E 2 / DALL·E 3DALL·E 2・3 APIは終了済み——旧画像生成コードは移行必須、後継はGPT ImageOpenAI Developer Community公式廃止案内
- Microsoft Copilot in ExcelExcel Copilotが“AIを選べる表計算”へ——GPT-5.6とClaude Opus 5、Autoも用意Microsoft 365 Copilot公式ブログ
7件
- MANTA(AI研究)arXiv論文:複数AIが仕事中に「チーム編成」を組み替えるMANTA——5評価の平均74.0で従来最高を5.8ポイント上回るarXiv(未査読プレプリント)
- Qwen-UI-Agent(AI研究)arXiv:Qwenの画面操作AI、実機で成功率92.2%——1万環境で100手超を学習arXiv(未査読技術報告)
- MIND(AI研究)arXiv論文:AIの「記憶」に混ぜた攻撃指示を軽量検出——MINDは攻撃成功率を約55%減らし、速度を維持arXiv(未査読プレプリント)
- ExtractBench(AI研究)arXiv論文:企業文書を読むAIを4869ページで比較——長い一覧は欠落しやすく、精度と費用に大差arXiv(未査読プレプリント)
- SafeKeep(AI研究)arXiv論文:AIに道具の仕様を渡すだけで拒否が弱まる——SafeKeepは攻撃成功率を25.6%から2.5%へarXiv(未査読プレプリント)
- ANCHOR(AI研究)arXiv論文:長く話す相棒AI、過去の流れを覚える正確さは平均44.4%——4モデルで人格維持も不安定arXiv(未査読プレプリント)
- GitHub CopilotGitHub、Copilot Billing Previewを本日終了——AI利用量・予算管理は標準の請求画面へ移行GitHub公式Changelog
6件
- ORCA-bench(AI研究)arXiv論文:本番障害を調べるAI、現実的な設定で正答25.3%——難しい課題は10.0%arXiv(未査読プレプリント)
- InfoOps Bench(AI研究)arXiv論文:情報工作へのAIの拒否率は8.8〜94.5%——17モデルを実例2100件超で検証arXiv(未査読プレプリント)
- OSReward(AI研究)arXiv論文:パソコン操作AIの採点モデルは失敗を成功と見なしやすい——低コスト判定AIを公開arXiv(作業中・未査読プレプリント)
- ローカルPC操作AI研究arXiv論文:手元で動くPC操作AI、履歴を増やしても成功率は28.56%で頭打ち——長く考えさせても効果薄arXiv(未査読プレプリント)
- Change2Task(AI研究)arXiv論文:実際のコード変更からAI向け課題を自動再現——Change2Taskは検証済み課題を29.2%多く回収arXiv(未査読プレプリント)
- SaliTrap(AI研究)arXiv論文:AIは目立つ数字に引っぱられ常識を無視——12モデル中、最良でも罠を避けたのは54.8%arXiv(未査読プレプリント)
7件
- AISPA(AI研究)arXiv論文:商用AI 88製品のシステム指示を監査——約4割に利用者の利益とぶつかる指示arXiv(未査読プレプリント)
- Computer-Use Agent評価研究arXiv論文:パソコン操作AIの「失敗」判定15.3%が誤り——5ベンチマーク150件を再監査arXiv(未査読プレプリント)
- 画像モデレーション評価研究arXiv論文:画像AIの安全判定、白黒化や色反転でも回避可能——商用3サービスを横断検証arXiv(未査読プレプリント)
- ReToken(AI研究)arXiv論文:長い動画を読むAI、必要な映像だけ選ぶ「1トークン」で精度向上——単一H100で学習・推論arXiv(未査読プレプリント)
- AskChem(AI研究)arXiv論文:化学論文14.7万本を「根拠付き主張」240万件へ分解——AI検索基盤AskChemを公開arXiv(未査読プレプリント)
- Sample More, Reflect Less(AI研究)arXiv論文:AIの「反省・書き直し」、同じ文字数なら単純な複数回答に勝てず——36比較で検証arXiv(未査読プレプリント)
- Astra(OpenAI研究)OpenAI研究発表:AIが数学・理論計算機科学の未解決問題10件を前進——Leanで証明を機械検証、探索費用は約2000ドルOpenAI Research(研究発表・論文)